본문 바로가기

주메뉴 바로가기

전체메뉴

미디어룸

오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.

모델 비교 지표가 갈라진 성능, 세부 항목 확인이 필요하다

AI 트렌드2026.09.11
2026.09.11  ·  ONE AI 편집장
Daily
AI Trend

넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다

01 / 06
모델 평가 · 세부 지표
종합 점수가 같아도 세부 지표는 갈린다

같은 점수를 받은 모델이 개별 평가에서는 정반대 결과를 보였다는 설명과, 출시 이후 체감이 달라졌다는 사례가 함께 공유됐습니다.

WHAT HAPPENED

Artificial Analysis 가 조작됐다는 비판이 확산되자, 한 작성자는 해당 지표가 10개 평가를 가중 집계한 값이고 비공개 평가는 AA-Briefcase 하나뿐이며 가중치 산출 방식도 공개돼 있다는 점을 들어 반박했습니다. 이 사이트가 광고 없이 자체 자금으로 테스트를 진행하며 Fable 5.1 모델 테스트에만 13,129달러를 지출했다는 설명도 함께 제시했습니다①.

같은 글은 552B DeepSeek V4.1-Flash 와 180B Qwen 3.8-Flash-Next 의 종합 점수가 40으로 동일하지만, 전자가 에이전트형 SaaS 워크플로우 평가(AutomationBench-AA)에서는 GPT-6 Astra(Max)까지 앞선 반면 AA-Omniscience 환각 억제 지표에서는 크게 뒤처졌다는 예시를 들었습니다①.

다른 게시글에서는 Astra 모델이 출시 초기에는 한 번의 시도로 높은 완성도의 결과물을 냈지만 이틀 뒤부터 동일한 xhigh 노력 수준으로 여러 번 재시도해도 품질이 떨어졌다는 사례가 공유됐고, 작성자는 이를 컴퓨팅 자원 절약을 위한 조용한 성능 조정이라고 주장했습니다②.

WHAT IT MEANS

두 자료 모두 공개된 점수 하나로 모델 상태를 판단할 수 있는지를 쟁점으로 삼고 있습니다. 앞의 사례에서는 종합 점수가 같은 두 모델이 에이전트형 작업과 환각 억제에서 서로 다른 결과를 보였다는 점이 확인되고, 뒤의 사례는 같은 모델의 결과가 시점에 따라 달라졌다는 사용자 경험이 공유된 수준입니다.

모델을 비교할 때 종합 점수보다 자사 용도와 가까운 세부 평가 항목을 먼저 확인할 필요가 있습니다. 에이전트형 작업 능력과 사실 정확도는 같은 점수 안에서도 결과가 갈렸기 때문입니다. 성능 변동에 대한 주장은 확인되지 않았으므로, 일반적인 현상으로 보기보다 자사에서 쓰는 대표 작업을 같은 조건에서 비교해 보는 정도가 확인할 수 있는 방법입니다.

출처
02 / 06
추론 비용 · 캐시 요구량
모델 사양 비교에 캐시 요구량이 들어온다

새 모델 공개에서 강조된 수치가 파라미터 규모가 아니라 활성 파라미터와 캐시 요구량 쪽에 놓였습니다.

WHAT HAPPENED

DeepSeek 은 Causal-Encoder-Decoder 라는 비대칭 구조를 채택한 552B 규모 MoE 모델 V4.1 Flash 를 공개했으며, 입력 측 8B·출력 측 16B 의 파라미터만 활성화되는 방식이라고 설명했습니다①.

KV 캐시 요구량은 이전 세대 대비 HBM 4분의 1, SSD 8분의 1 수준으로 줄었고 1세대 모델과 비교하면 캐시 크기가 437배 축소됐다고 밝혔습니다②.

LiveBench 평가에서는 GPT-5.6 Sol 과 동등한 수준의 성능을 10분의 1 가격으로 달성한 것으로 나타났습니다③.

다만 커뮤니티 분석에서는 허깅페이스 표기인 485B 가 FP4 패킹 때문에 축소 표기된 값이며, 인그램과 MTP 모듈까지 포함하면 실제로는 748B 에 달한다는 주장이 공유됐습니다④.

WHAT IT MEANS

공개된 설명에서 강조된 항목은 파라미터 총량이 아니라 활성화되는 파라미터 수와 캐시 요구량이었고, 성능은 동등 수준이면서 가격은 10분의 1이라는 평가 결과가 함께 제시됐습니다. 모델 비교에서 확인할 항목이 규모와 점수 외에 캐시 요구량과 가격까지 넓어진 사례로 볼 수 있습니다.

표기 규모를 둘러싼 주장이 함께 나온 만큼, 공개 스펙만으로 필요한 자원을 산정하기 어렵다는 점도 확인할 필요가 있습니다. 도입을 검토한다면 파라미터 수와 함께 실제로 확보해야 할 메모리와 캐시 요구량을 확인 항목으로 둘 수 있고, 가격 비교도 단가와 함께 자사 작업 기준으로 환산해 비교 기준을 잡을 수 있습니다.

출처
Reddit ① ·  ·  ·
03 / 06
연구 성과 · 검증
AI 수학 성과, 발표와 별개로 검증 논의가 이어진다

추가 난제 진전 발표, 학습 데이터 출처 의혹, 수학자들의 공개서한이 같은 시점에 확인됐습니다.

WHAT HAPPENED

OpenAI 는 수요일 밤 성명에서 나비에-스토크스 관련 성과 이후 또 다른 밀레니엄 문제에서 실질적 진전을 이뤘다고 밝히며, 발표 방식을 신중히 고민 중이라는 입장을 함께 전했습니다①.

일부 연구자들은 OpenAI 모델이 기존 학자들의 연구 노트나 대화 내용을 학습 데이터로 활용한 것이 아니냐는 의혹을 제기했으나, OpenAI 가 이를 부인하면서 공식적으로 확인되지는 않았습니다②.

온라인에서는 호지 추측, 버치-스위너턴다이어 추측 등 추가 밀레니엄 문제도 곧 해결될 것이라는 루머가 확산됐습니다③.

같은 시점에 수학자 1000여 명이 AI 를 수학 연구에 활용하는 흐름에 반대하는 공개서한에 서명했습니다. 서한은 AI 가 생성한 증명이 겉으로는 정답처럼 보여도 검증되지 않은 논리적 허점을 포함할 수 있다는 점과, 이런 연구 방식이 수학 교육과 학문적 엄밀성을 훼손할 위험을 지적했습니다④.

WHAT IT MEANS

성과 발표, 데이터 출처 의혹, 루머 확산, 공개서한이 같은 시점에 나타났고, 그중 의혹과 루머는 확인되지 않은 상태로 남아 있습니다. 공개서한이 문제로 지적한 것도 결과의 정확도가 아니라 검증되지 않은 논리적 허점이었습니다. 네 가지 모두 성과 자체보다 그것을 어떻게 확인할 것인지를 다루는 쟁점으로 볼 수 있습니다.

AI 산출물을 업무 결과로 쓸 때도 확인 절차가 마련돼 있는지를 함께 볼 필요가 있습니다. 전문 영역의 산출물은 내용을 판단할 수 있는 사람이 검토하지 않으면 허점을 발견하기 어렵다는 점이 서한에서 지적된 내용입니다. 외부에 제시할 결과라면 어떤 근거로 만들어졌는지 설명할 수 있는지도 확인 항목으로 둘 수 있습니다.

출처
Reddit ① ·  ·  ·
04 / 06
응답 출처 · 데이터 전송
어느 모델이 답했는지가 확인 대상이 된다

대량 질의 전송 규모가 보도로 나온 데 이어, 이용자에게 제공된 응답의 출처를 둘러싼 의혹까지 제기됐습니다.

WHAT HAPPENED

WSJ 보도와 관련 게시글에 따르면 14일이라는 기간 동안 Alibaba 는 1억 5,100만 건, Moonshot(Kimi)은 2,300만 건, DeepSeek 은 1,200만 건의 대화를 Claude 계열 모델에 보낸 것으로 나타났으며, 이는 자사 모델을 상위 모델의 응답으로 학습시키는 증류 방식으로 해석되고 있습니다①.

Kimi 와 DeepSeek 이 자사 서비스 이용자에게 실제로는 Claude Opus 의 응답을 제공하면서 그 사고 과정까지 수집했다는 의혹이 제기됐으나, 공식적으로 확인되지는 않았습니다②.

WHAT IT MEANS

전송 규모는 보도로 수치가 제시된 반면, 이용자에게 제공된 응답을 어느 모델이 생성했는지에 대한 부분은 의혹 단계에 머물러 있습니다. 두 사실 모두 서비스가 내부적으로 어떤 모델을 경유하는지에 대한 확인 가능성을 쟁점으로 삼고 있습니다.

모델을 도입할 때 어떤 모델을 쓰는지에 더해, 그 서비스가 외부 모델이나 API 를 경유하는 구조인지와 입력한 내용이 어디까지 전달되는지를 계약 단계에서 확인할 수 있습니다. 응답 생성 경로가 명시되는지 여부 자체를 서비스 비교 기준으로 삼을 수 있습니다.

출처
05 / 06
AI 규제 · 위험 인식
규제 필요성을 개발사 쪽에서 제기하다

개발사가 의무 규제를 공식 요청하고 악용 차단 사례를 직접 공개한 반면, 정책 결정 쪽에서는 낙관적 발언이 확인됐습니다.

WHAT HAPPENED

OpenAI 는 의회에 AI 에 대한 의무적인 국가 안전 규제 마련을 공식적으로 요청했습니다①.

Anthropic 은 자사 모델이 생물무기 제작에 악용될 가능성이 있는 시도를 차단했다고 밝혔습니다②.

반면 트럼프 대통령은 AI 위험에 대해 결국 괜찮을 것이고 멈출 방법이 있을 것이라는 취지로 발언했습니다③.

WHAT IT MEANS

이번 자료에서는 규제 필요성을 제기한 쪽과 악용 차단 조치를 공개한 쪽이 모두 모델을 만드는 회사였고, 제도를 만들 위치에 있는 쪽에서는 낙관적 인식이 확인됩니다. 같은 위험을 두고 서로 다른 위치에서 다른 수준의 판단이 나온 사례로 볼 수 있습니다.

제도 변화를 예측하기보다, 공급자가 현재 어떤 악용 차단 조치를 운영하고 그 결과를 어떻게 공개하는지를 확인하는 편이 현실적입니다. 도입 계약을 검토할 때 관련 정책과 통제 범위, 문제가 발생했을 때의 대응 절차를 확인 항목에 포함할 수 있습니다.

출처
06 / 06
로컬 실행 · 실행 설정
같은 장비에서도 실행 설정에 따라 결과가 달라진다

캐시 배치와 배치 크기, 양자화 수준을 바꿔 속도를 끌어올린 개별 사례들이 여러 환경에서 공유됐습니다.

WHAT HAPPENED

2x3090 환경에서 프롬프트 처리 중 전문가 캐시를 GPU 에서 내리고 배치 크기를 512에서 2048로 늘려 프리필 속도를 2.2~2.5배 높인 사례가 공유됐습니다①.

16GB 카드에서 27B 비전 모델을 IQ3_XXS 양자화로 8.5만 토큰 컨텍스트까지 구동한 설정도 공유됐습니다②.

GGUF 양자화의 텐서별 레이아웃을 개선한 업로드 방식③과, React Native ExecuTorch 의 최대 92배 속도 개선 사례가 공개됐습니다④.

한편 Flash 로 불리는 모델이 512GB 환경을 요구하게 된 상황을 두고 커뮤니티에서 논의가 이어졌습니다⑤.

WHAT IT MEANS

공유된 사례들이 조정한 대상은 모델 자체가 아니라 캐시 배치, 배치 크기, 양자화 수준 같은 실행 설정이었습니다. 실행 설정에 따라 결과가 달라질 수 있다는 사례로 볼 수 있으며, 각 수치는 해당 환경에서 공유된 값입니다.

로컬 실행 가능 여부를 카드의 메모리 용량만으로 판단하기 어렵다는 점을 확인할 수 있습니다. 사용할 추론 엔진과 양자화 수준, 필요한 문맥 길이, 배치 설정을 함께 정한 뒤 자사 조건에서 재검증할 필요가 있습니다.

출처
Reddit ① ·  ·  ·  ·
Notice ONE AI 편집장  ·  2026-09-11

본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.

ONE AI 세미나 신청
구매상담
1688
5000