오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.
GPT-6.1 Sol, 지능 지수 순위와 가격 대비 성능 평가가 갈렸다
넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다
OpenAI가 데브데이에서 발표한 GPT-6.1 Sol은 Artificial Analysis(AA)의 지능 지수 결과에서 Opus 5.5, Sonnet 5.5, Fable 5.1, Astra보다 낮은 점수를 받은 것으로 공유됐습니다①.
커뮤니티에서는 GPT-6.1 Sol이 Sonnet 5.5의 절반, GPT-5.6 Sol의 3분의 1, Opus 5.5의 5분의 1 수준 비용으로 Astra에 가까운 성능을 낸다는 평가가 공유됐습니다②.
AA가 새로 제시한 파레토 라인(같은 비용에서 가장 높은 지능 지수를 낸 모델들을 잇는 가격 대비 성능 경계선)에는 GPT-6.1 Sol이 포함됐습니다③.
모델을 비교할 때 지능 지수 순위와 가격 대비 성능 위치는 서로 다른 답을 줄 수 있습니다.
GPT-6.1 Sol은 지능 지수만 놓고 보면 상위 모델들보다 낮았지만, 비용 축을 함께 놓자 효율 경계선 안에 들어갔습니다. 즉 같은 평가 결과라도 성능 점수 하나로 줄 세우는지, 비용과 함께 보는지에 따라 모델의 위치가 달라집니다. 다만 'Astra에 가까운 성능'은 커뮤니티에서 공유된 평가이고, 파레토 라인 포함은 AA 결과에서 확인되는 내용이라 근거의 성격은 다릅니다.
업무용 모델을 비교할 때는 최고 점수 모델인지 여부와 함께, 필요한 성능 수준을 어느 정도 비용으로 얻을 수 있는지를 별도의 비교 기준으로 둘 수 있습니다.
Anthropic은 모델 가중치가 공개돼 누구나 내려받아 쓸 수 있는 중국의 오픈웨이트 모델 GLM이 스스로 작동하는 해킹 도구를 만들어낼 수 있다는 내용의 보고서를 공개했습니다. 보고서는 이 모델이 고급 사이버 공격 능력을 확산시킬 위험이 있다고 경고했습니다①②.
로컬 LLM 커뮤니티에서는 이 보고서가 오히려 GLM의 성능을 가장 잘 알리는 홍보물이 됐다는 반응이 나왔습니다③.
이번 사례에서 위험성 경고는 동시에 모델이 무엇을 할 수 있는지에 대한 능력 평가로도 읽혔습니다.
보고서의 경고는 GLM이 해킹 도구를 만들 수 있을 만큼의 능력을 갖췄다는 판단 위에 서 있습니다. 커뮤니티 반응은 이 판단을 위험 신호가 아니라 성능 근거로 받아들인 것으로, 같은 문서 안에서 위험과 능력이 분리되지 않고 함께 읽힌 사례로 볼 수 있습니다.
레딧 게시글에 따르면 OpenAI의 월 200달러 Pro 플랜(20배 사용량 한도로 알려짐)은 사용량이 절반으로 줄고, 새로 도입되는 월 500달러 요금제가 기존 200달러 플랜과 비슷한 사용량 한도를 제공할 예정인 것으로 알려졌습니다. 같은 수준의 사용량을 기준으로 보면 월 요금이 200달러에서 500달러로 2.5배가 되는 구조입니다①.
다른 게시글에서는 이 변경을 두고 보조금이 붙은 컴퓨팅 자원의 시대가 끝나가고 있다고 평가하며, 그동안 OpenAI가 원가 이하로 컴퓨팅 자원을 제공해왔을 가능성을 제기했습니다②.
이번 논란에서 가격 변화는 월 요금표가 아니라 같은 요금으로 쓸 수 있는 사용량 한도 쪽에서 드러났습니다.
200달러라는 요금은 그대로 두고 한도를 줄이는 방식이라 요금표만 보면 변화가 잘 보이지 않지만, 같은 사용량을 기준으로 하면 부담이 달라집니다. 이를 원가 이하 제공의 종료로 보는 해석은 게시자의 평가이며, OpenAI의 실제 원가 구조가 공개된 것은 아닙니다.
구독형 AI 서비스를 비교할 때 월 요금과 함께 사용량 한도가 어떤 단위로 정해져 있는지, 같은 요금제 안에서 한도가 바뀐 적이 있는지를 비교 항목에 포함할 수 있습니다.
커뮤니티에서는 Qwen3.8 27B 모델을 16GB 그래픽 메모리(VRAM)의 AMD GPU에서 모델 용량을 줄이는 Q4 양자화 설정과 100K 컨텍스트로 구동해 초당 30토큰의 생성(디코딩) 속도를 냈다는 사례가 공유됐습니다①.
여러 전문가 모듈 중 일부만 골라 쓰는 MoE 구조의 Qwen3.8-Flash-Next에 GSQ·RCO라는 새 양자화 기법을 적용한 모델 파일이 공개됐습니다. 가중치 하나당 평균 3.50비트(3.50bpw) 설정에서 GPQA-Diamond 점수가 92.93과 91.92로 제시돼 BF16 원본과 동등한 수준이라고 소개됐으며, 전문가 모듈 절반을 제거한 코더 특화 빌드는 평균 1.89bpw까지 압축됐습니다②.
vLLM에는 MoE 모델의 전문가 모듈 단위로 일부를 시스템 메모리(RAM)에 옮겨 두는 오프로딩 기능이 추가됐고, 이를 활용해 R9700 GPU 4장으로 DeepSeek-V4급 대형 모델을 구동한 사례가 공유됐습니다③.
이번 사례들은 로컬 환경에서 모델을 돌리는 방법을 모델 용량을 줄이는 방식과 메모리를 여러 곳에 나눠 쓰는 방식으로 구분해 보여줍니다.
양자화 사례에서는 bpw 같은 용량 설정과 함께 벤치마크 점수, 컨텍스트 길이, 생성 속도가 제시됐고, 오프로딩 사례에서는 GPU 장수와 구동한 모델 규모가 제시됐습니다. 즉 두 방식은 내놓는 수치의 종류가 달라 한쪽 수치로 다른 쪽을 직접 비교하기 어렵고, 모두 특정 장비와 설정에서 공유된 사례라는 점도 함께 봐야 합니다.
한 레딧 이용자는 북미 기업 환경에서 AI가 이미 업무의 절반을 차지할 만큼 일상화됐는데도 레딧 커뮤니티 다수는 AI를 쓸모없는 기술로 본다며 이 차이를 지적했습니다①.
챗봇 등장 4년 만에 전 인류의 20%가 사용한다는 통계가 공유됐으며, 해당 게시글에서는 구글 AI 오버뷰 같은 부가 이용까지 더하면 확산 속도가 역사상 전례가 없다는 평가가 나왔습니다②.
OpenAI의 연환산 매출(ARR, 현재 매출 흐름을 1년 기준으로 환산한 값)이 700억 달러에 근접했다는 소식이 공유됐습니다③.
같은 'AI 확산'이라는 말이라도 무엇을 세느냐에 따라 가리키는 대상이 다릅니다.
20%는 전체 인구 가운데 챗봇 이용자의 비율이고②, 700억 달러는 한 기업의 연환산 매출 규모이며③, '업무의 절반'은 한 이용자가 관찰한 업무 환경에 대한 주장입니다①. 세 수치 모두 AI가 얼마나 쓰이거나 지불되는지를 보여주지만, 업무 성과나 생산성이 얼마나 달라졌는지를 직접 보여주지는 않습니다.
AI 도입 현황 자료를 참고할 때 이용자 비율, 지불 규모, 업무 내 사용 비중을 서로 다른 지표로 나눠 두고, 매출 규모와 수익성도 별개의 항목으로 구분해 볼 수 있습니다.
한 익명의 연구자는 레딧 글에서 ML 연구 분야가 알고리즘 효율성보다 컴퓨트(연산 자원) 규모에 집착하고 있다고 비판했습니다. 논문이 통과되려면 더 큰 규모의 손실 곡선(학습 진행을 보여주는 그래프)이나 더 많은 파라미터 수를 보여줘야 하는 분위기가 있고, 병목을 최적화하기보다 GPU를 더 투입하고 넘어가는 관행이 있다는 주장입니다①.
CVPR 제출을 준비하는 한 연구자는 컴퓨트가 부족한 상황에서 여러 시드(무작위 초기값)로 실험을 반복해 통계적으로 검증할지, 현재 결과로 논문 작성에 집중할지에 대한 고민을 공유했습니다②.
이번 사례들에서는 연구 결과의 설득력이 아이디어뿐 아니라 쓸 수 있는 연산 자원의 양과도 얽혀 있다는 문제가 제기됐습니다.
첫 번째 글은 결과의 규모를 키우는 데, 두 번째 고민은 같은 결과를 반복해 검증하는 데 컴퓨트가 필요하다는 점을 보여줍니다. 즉 공개된 연구 결과를 볼 때 실험 규모가 크다는 것과 반복 검증을 거쳤다는 것은 서로 다른 조건으로 구분해 볼 수 있습니다.
본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.
이전글이 없습니다
다시 열리는 호남 전력망, 짧아지는 2주택 특례
2026.09.29