오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.
Gemini 4 Argon, 벤치마크 우위와 내부 코딩 평가 사이의 간극
넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다
공개된 벤치마크 결과에서 Gemini 4 Argon은 18개 항목 중 12개에서 Fable 5.1, Opus 5.5, GPT-6 Astra를 앞섰습니다. 자율 법률 작업 평가에서는 19.6%를 기록해 GPT-6 Astra의 5.4%를 웃돌았습니다①.
블룸버그 보도에 따르면 구글 내부 직원들은 실제 코딩 업무에서 이 모델이 어려움을 겪는다고 지적했습니다②.
벤치마크 다수 항목에서 앞섰다는 결과가 실제 코딩 업무에서의 평가까지 보장하지는 않았습니다. 이번 사례에서는 같은 모델을 두고 공개 점수와 내부 사용 평가가 같은 방향을 가리키지 않았습니다.
공개된 결과는 정해진 평가 항목에서의 점수이고, 내부 직원들의 지적은 실제 코딩 업무에서 써본 경험에 관한 것입니다. 측정하는 대상과 평가하는 주체가 다르기 때문에 한쪽 결과로 다른 쪽을 대신하기 어렵습니다. 또 이번 벤치마크에서 격차가 크게 나타난 항목은 법률 작업이었고 문제로 지적된 영역은 코딩이어서, 두 평가가 다룬 업무 영역 자체도 같지 않습니다.
Artificial Analysis 벤치마크에서 Gemini 4 Argon은 GPT-6 Astra와 같은 점수를 받으면서 비용은 40% 낮다는 평가가 나왔습니다①. 지능 지수 53을 Opus 5.5의 약 3분의 1 수준 비용으로 기록했다는 분석도 공유됐습니다②.
수학 벤치마크 MathArena에서 GPT-6.1 Sol은 정확도 86.3%로 1위에 올랐으며, 이때 든 비용은 0.94달러였습니다. 같은 평가에서 Astra는 81.9% 정확도에 2.26달러가 들었습니다③.
모델 순위표만으로는 보이지 않는 차이가, 비슷한 결과를 내는 데 드는 비용에서 나타났습니다.
두 결과는 서로 다른 벤치마크에서 나온 것이어서 비용 수치를 서로 직접 견줄 수는 없습니다. 다만 각 평가 안에서 보면 Gemini 4 Argon은 점수 차이 없이 비용이 낮았고, GPT-6.1 Sol은 4.4%포인트 높은 정확도를 절반 이하의 비용으로 기록해 점수 차이보다 비용 차이가 더 두드러졌습니다③.
모델 성능 수치를 볼 때 같은 평가 안에서 점수와 비용이 함께 제시됐는지, 그 비용이 어떤 기준으로 집계됐는지를 판단 기준으로 둘 수 있습니다.
한 소프트웨어 엔지니어는 과거 신입 직원에게 맡기던 업무를 이제 Opus 5.5가 5분 만에 95% 이상의 정확도로 처리한다는 경험을 공유했습니다. 그는 GDPval 벤치마크에서 전문가 대비 승리 또는 동률을 기록한 작업 비율이 작년 12월 GPT-5.2는 71%, 올해 4월 GPT-5.5는 85%, Opus 4.7은 80%였다고 언급하며, 모델이 한 단계씩만 나아지는 것처럼 보여 실제 발전 속도를 체감하기 어렵다고 주장했습니다①.
6년 넘게 AI 분야를 지켜봤다는 다른 작성자는 2019년 『슈퍼인텔리전스』를 읽을 당시 수십 년은 걸릴 것으로 예상했던 수준의 대화형 AI가 이미 현실이 됐다고 적었습니다②.
이번 게시글들에서는 AI 발전 속도가 실제보다 느리게 받아들여진다는 주장이, 벤치마크 수치와 개인의 과거 예상이라는 서로 다른 기준에서 나왔습니다.
첫 번째 주장은 본인의 업무 경험과 전문가 대비 작업 결과를 비교하는 GDPval 수치를, 두 번째 주장은 수년 전 자신의 예상과 현재 사이의 차이를 근거로 삼았습니다. 두 주장 모두 커뮤니티 작성자 개인의 해석이며, GDPval 수치도 서로 다른 시점·모델의 결과를 작성자가 이어 소개한 것이어서 한 모델이 성장한 기록으로 읽기는 어렵습니다.
하드웨어에 맞춰 커널을 직접 컴파일하고 튜닝하는 오픈소스 추론 엔진이 공개됐으며, llama.cpp보다 최대 2배 빠른 속도를 낸다고 소개됐습니다. 애플 실리콘, 엔비디아, AMD, CPU 전용 환경을 지원합니다①.
Strix Halo APU에 R9700 GPU를 PCIe 확장이나 Thunderbolt로 연결하는 llama-halo-hybrid 프로젝트는 모델의 밀집 레이어와 KV 캐시 일부를 GPU에, 나머지를 APU에 나눠 배치하는 구조입니다. 제작자는 디코딩 속도 60tok/s 이상, 프리필 2000tok/s 이상, 256k 전체 컨텍스트 지원을 제시하며 DGX Spark보다 나은 성능을 보였다고 밝혔습니다②.
이번 사례에서 로컬 AI 실행 속도는 장비 사양만이 아니라, 어떤 실행 소프트웨어를 쓰고 모델 연산을 장치 사이에 어떻게 나누느냐를 근거로 제시됐습니다.
추론 엔진은 장비별로 기본 연산 프로그램인 커널을 맞춰 조정하는 방식으로 기존 실행 도구인 llama.cpp 대비 속도를 내세웠고, llama-halo-hybrid는 모델 일부를 GPU에, 나머지를 APU에 나눠 두는 방식으로 처리 속도와 한 번에 처리할 수 있는 입력량인 컨텍스트 길이를 제시했습니다. 두 결과 모두 제작자 측이 밝힌 수치이고 비교 대상도 llama.cpp와 DGX Spark로 서로 달라, 같은 기준에서 측정된 값으로 보기는 어렵습니다.
로컬 실행 성능 수치를 비교할 때는 장비 이름과 함께 어떤 실행 도구와 연산 배치 방식에서 측정됐는지, 무엇과 비교한 결과인지를 확인 항목에 포함할 수 있습니다.
Qwen 3.8 27B 기반 파생 모델인 Dirk-Qwen3.8-27B와 Swift-1.5-Qwen3.8-27B를 비교한 테스트에서, ‘be brief’ 지시를 활용한 Dirk-Qwen이 더 적은 토큰으로 더 많은 정답을 냈다고 보고됐습니다. Swift-1.5는 어려운 질문에서 16,384 토큰 한계에 도달해 답변이 중간에 잘리는 실패가 발생했습니다①.
BAAI는 Qwen3.8 27B를 기반으로 한 에이전트 모델 AREX-2를 공개했습니다②.
같은 기반 모델에서 출발했다고 해서 같은 성격의 모델이 되는 것은 아니며, 이번 사례에서는 하나의 기반 모델 위에서 서로 다른 작업을 겨냥한 파생 모델이 나왔습니다.
Dirk-Qwen과 Swift-1.5 비교에서는 같은 기반 모델과 같은 조건에서도 답을 내는 데 쓰는 토큰(모델이 처리하는 텍스트 단위) 양과 정답 수가 달랐고, 한쪽은 출력 한도에 걸려 답이 잘리기도 했습니다. 따라서 모델 이름에 붙은 기반 모델만으로는 실제 응답 방식이나 작업 적합성을 알기 어렵고, 파생 모델마다 따로 나온 평가 결과를 기준으로 볼 필요가 있습니다.
본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.
이전글이 없습니다
CISO 임원 의무화, 1년 이상 실측 의무 폐지
2026.09.30