본문 바로가기

주메뉴 바로가기

전체메뉴

미디어룸

오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.

가격 인하와 비용 대비 성능, 새 모델 비교의 한 축으로

AI 트렌드2026.09.23
AI 트렌드

넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다

01 / 06모델 가격 · 비용 대비 성능
새 모델 비교, 점수 옆에 가격과 비용 대비 성능이 함께 놓였다
WHAT HAPPENED

OpenAI는 GPT-6 시리즈 가운데 Sol과 Luna를 공개하며 가격을 GPT-5.6의 절반 수준으로 책정했습니다①.

Anthropic의 Claude Opus 5.5는 이전 버전보다 40% 저렴해졌다는 내용과 함께 공개됐고②, Terminal-Bench 4.0에서 비용 대비 성능이 뛰어나다는 분석도 공유됐습니다③.

커뮤니티에서는 Agents' Last Exam 벤치마크에서 GPT-6 Sol이 Claude Opus 5보다 60% 낮은 비용으로 더 높은 성능을 기록했다는 결과가 공유됐습니다④.

WHAT IT MEANS

이번 모델 발표에서는 성능이 얼마나 높은지와 함께, 그 성능을 얼마의 비용으로 얻는지가 비교 대상으로 올라왔습니다.

GPT-6 Sol·Luna와 Opus 5.5 모두 이전 버전보다 낮은 가격이 함께 언급됐고, 벤치마크 결과도 점수 하나가 아니라 비용 대비 성능 형태로 공유됐습니다. 다만 절반과 40%라는 가격 인하 폭은 각자 이전 버전을 기준으로 한 값이고, 60%라는 비용 차이는 특정 벤치마크에서 경쟁 모델과 비교한 결과여서 숫자의 기준이 서로 다릅니다.

모델을 비교할 때는 가격 인하율이 무엇을 기준으로 한 값인지, 비용 대비 성능이 어떤 벤치마크에서 측정됐는지를 함께 확인 항목에 포함할 수 있습니다.

02 / 06지능 지수 · 오픈소스 모델
최상위 모델과 오픈 모델의 격차, 점수 차와 추격 기간 두 가지로 읽혔다
WHAT HAPPENED

Claude Opus 5.5는 Artificial Analysis Intelligence Index에서 58점으로 전체 1위에 올랐습니다①. 같은 지수에서 최고 성능 오픈소스 모델로 언급된 MiMo 2.6 Pro는 46점으로, 두 모델의 차이는 12점입니다②.

커뮤니티에서는 오픈소스 모델 최고점이 두 달 사이 44점에서 46점으로 오른 추세를 근거로, 오픈 모델이 58점에 도달하려면 최소 4~6개월이 걸릴 것이라는 전망이 제기됐습니다②.

WHAT IT MEANS

이번 자료에서 최상위 상용 모델과 오픈 모델의 차이는 현재의 점수 차와 따라잡는 데 걸릴 기간이라는 두 가지 방식으로 표현됐습니다.

12점 차이는 같은 지수 안에서 확인된 측정값인 반면, 4~6개월이라는 기간은 최근 두 달의 상승 폭을 바탕으로 커뮤니티가 내놓은 추정입니다. 같은 격차 논의라도 지금 측정된 값과 앞으로를 가정한 계산은 성격이 다르므로 나눠서 읽을 필요가 있습니다.

03 / 06GPT-6 Astra · 특정 과제 평가
GPT-6 Astra, 다른 모델이 통과하지 못한 과제에서 성공 사례가 공유됐다
WHAT HAPPENED

커뮤니티에서는 GPT-6 Astra가 바흐 스타일의 4성부 화성곡을 규칙 오류 없이 작곡했으며, 음악적 추론에서 이전 AI가 해내지 못한 수준이라는 사례가 공유됐습니다①.

자율주행 시뮬레이션 코스에서는 GPT-6 Astra가 두 번째 시도에서 통과해, 이 코스를 성공적으로 통과한 유일한 AI 모델이라는 내용이 공유됐습니다②.

WHAT IT MEANS

GPT-6 Astra의 이번 사례는 종합 점수가 아니라, 성공과 실패가 분명하게 갈리는 특정 과제에서의 결과입니다.

화성학 규칙을 어기지 않는 작곡과 시뮬레이션 코스 통과는 모두 결과물이 정해진 기준을 충족했는지로 판정되는 과제입니다. 커뮤니티에서 공유된 사례인 만큼, 해당 과제에서의 성공을 다른 업무 영역의 성능으로 넓혀 보기보다는 특정 과제에서 확인된 결과로 읽는 것이 적절합니다.

04 / 06오픈웨이트 · 증류 모델
오픈 모델이 단일 모델이 아닌 크기·용도별 변형과 함께 공개됐다
WHAT HAPPENED

IFM의 K2-Horizon은 36B부터 0.9B까지 다양한 크기의 GGUF 양자화 버전이 공개됐으며, llama.cpp에서는 아직 포크 버전으로만 실행할 수 있는 상태입니다①.

AntLing은 6B급 이미지 모델 Ming-Image-0.1-Design과 레이어 버전을 오픈소스로 공개했고, Ling UI Design Skill과 이미지를 편집 가능한 PPT로 바꾸는 스킬도 함께 내놨습니다. 이 모델은 Artificial Analysis의 UI/UX 디자인 리더보드에서 오픈웨이트 모델 중 1위를 기록했습니다②.

샤오미는 MiMo-V2.6을 공개하면서③, Qwen3.5-9B를 기반으로 MiMo가 생성한 데이터로 추가 학습한 에이전트 모델 MiMo-V2.6-Distill-Qwen-9B도 함께 출시했습니다④.

WHAT IT MEANS

이번 오픈 모델 공개에서는 모델 하나만이 아니라, 실행 환경과 용도에 맞춘 여러 형태가 함께 나왔습니다.

K2-Horizon은 모델 용량을 줄이는 양자화 버전으로, Ming-Image는 레이어 버전과 디자인·PPT 변환 스킬로, MiMo-V2.6은 큰 모델이 만든 데이터로 작은 모델을 추가 학습시킨 증류 모델로 나뉘어 공개됐습니다. 같은 '변형'이라도 달라진 대상이 용량, 작업 도구, 학습 방식으로 서로 다릅니다.

K2-Horizon처럼 공개 직후에는 기존 실행 도구의 정식 지원 없이 포크 버전에서만 구동되는 경우도 있어, 모델 공개 여부와 사용 중인 실행 도구에서의 지원 여부를 구분해서 볼 수 있습니다.

05 / 06양자화 · 로컬 LLM
같은 모델도 양자화 방식과 디코딩 설정에 따라 작업 완료와 처리 속도가 달랐다
WHAT HAPPENED

RTX 3060 12GB 환경에서 Qwen3.8-27B의 IQ3-XXS급 저비트 양자화 두 종을 비교한 사용자 사례가 공유됐습니다. 원본과의 유사도를 나타내는 KL-divergence 기준으로 높은 유사성을 내세운 ByteShape 양자화는 3D 복셀 생성 테스트에서 98K 토큰을 쓰고도 작업을 끝내지 못했고, GSQ-RCO 양자화는 55K 토큰에 작업을 완료했습니다①.

FreeToken 포크로 DeepSeek-V4.1과 Qwen3.8-Flash-Next를 2x3090 GPU에서 서빙한 벤치마크에서는, MTP 추측 디코딩을 CUDA 그래프 환경에서 적용했을 때 처리 속도가 48 tok/s에서 21.5 tok/s로 낮아진 결과가 제시됐습니다②.

WHAT IT MEANS

같은 모델이라도 어떤 양자화 방식과 실행 설정을 쓰는지에 따라 실제 작업 결과와 처리 속도가 크게 달라진 사례가 공유됐습니다.

양자화 비교에서는 원본과의 유사도 지표가 좋다고 알려진 쪽이 실제 작업에서는 더 많은 토큰을 쓰고도 완료하지 못했습니다. 디코딩 사례에서는 여러 토큰을 미리 예측해 생성 속도를 높이려는 MTP 추측 디코딩이, GPU 실행을 최적화하는 CUDA 그래프 환경에서는 오히려 처리 속도가 낮아진 결과로 나타났습니다.

두 사례 모두 개인 환경의 결과이므로 일반 법칙으로 보기보다는, 로컬 모델을 비교할 때 광고된 지표와 실제 작업 결과, 적용한 실행 설정을 별도 항목으로 둘 수 있다는 사례로 볼 수 있습니다.

06 / 06추론 모델 · 트랜스포머
추론 모델의 발전, 르쿤 주장의 입증인지 트랜스포머의 연장인지 해석이 갈렸다
WHAT HAPPENED

최근 추론 모델의 발전을 두고 얀 르쿤과 제프리 힌턴의 오래된 논쟁이 커뮤니티에서 다시 불거졌습니다. 한쪽은 추론 시점 탐색과 잠재 추론의 부상이 '자기회귀 트랜스포머만으로는 부족하다'는 르쿤의 주장을 입증한다고 봤습니다①.

반대쪽은 현재 추론 시스템도 여전히 트랜스포머 기반이라는 점을 들어, 르쿤이 기준을 계속 바꾸고 있다고 반박했습니다①.

르쿤은 인간과 유사한 추론이 토큰 공간이 아닌 연속 표현 공간에서의 탐색을 거쳐야 한다고 재차 강조했으며, 이 주장은 연속 사고 언어모델, 재귀 깊이 모델 같은 잠재 추론 연구 흐름과 연결돼 언급됐습니다①.

WHAT IT MEANS

같은 추론 모델의 발전을 두고, 이를 기존 구조의 한계를 보여주는 근거로 볼지 기존 구조의 연장으로 볼지 해석이 갈렸습니다.

한쪽은 추론 과정에서 답을 탐색하는 방식과 잠재 추론이라는 새로운 기법의 등장을, 다른 쪽은 그 시스템이 여전히 앞 단어를 바탕으로 다음 단어를 생성하는 트랜스포머 위에 있다는 점을 근거로 듭니다. 같은 현상을 보면서도 무엇을 '구조의 변화'로 인정할지에 대한 기준이 달라 결론이 엇갈리는 논쟁입니다.

출처

본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.

ONE AI 세미나 신청
구매상담
1688
5000