오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.
OpenAI 내부 성과 주장 확산, 공개된 검증 근거부터 확인해야 한다
넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다
레딧 커뮤니티에서는 OpenAI의 내부 모델이 한 달도 안 되는 기간에 수학 여러 분야에 걸친 100여 개의 오랜 미해결 문제를 풀었고 훈련 기간은 24일이었다는 주장이 확산됐습니다. 다만 모델명, 벤치마크 수치, 검증 방식 같은 공식적인 세부 정보는 공개되지 않은 상태입니다①②.
The Information은 OpenAI 내부에서 AI 모델이 AI 학습 과정 자체를 돕고 있다는 보고가 있었다고 전했습니다. 이 내용 역시 보도로 전해진 것으로, 공개된 자료만으로는 확인하기 어렵습니다③.
AI 성능에 대한 큰 폭의 성과 이야기가, 그 성과를 확인하는 데 필요한 정보보다 먼저 알려지는 경우가 있습니다.
두 내용 모두 개발사 내부에서 일어났다고 전해진 일이고, 외부에서 다시 확인할 수 있는 기준인 어떤 모델이 무엇을 어떻게 처리했는지와 누가 그것을 확인했는지는 함께 공개되지 않았습니다. 커뮤니티에서 반응이 빠르게 퍼지더라도 반응의 크기가 사실 확인을 대신하지는 않습니다.
Xiaomi MiMo 팀이 MiMo-V2.6 Pro-RL과 Flash-RL을 오픈웨이트로 공개했고①, 9B 크기의 Distill-Qwen 버전도 함께 공개됐습니다②.
공식 모델 페이지에 비교 차트가 없다는 지적과 함께, 한 이용자가 Perplexity를 이용해 만든 Terminal-Bench 4.0 비교 결과가 공유됐습니다. 이 비교에서 MiMo-V2.6-Flash-RL은 28.8%, DeepSeek-V4-Flash-0731은 12.0%, Qwen3.8-Flash-Next는 25.3%였고, GLM-5.3-Flash가 32.8%로 가장 높게 제시됐습니다③.
xAI가 Grok 4.7을 공개한 뒤 레딧에서는 초기 사용 인상과 벤치마크 결과가 각각 다른 게시글로 공유됐습니다④⑤. 이용자들은 프론트엔드 작업 능력을 다른 프론티어 모델과 비교했고, 백엔드 작업과 보안 관련 작업에 대한 평가도 함께 올렸습니다④.
새로 공개된 모델을 비교할 때 참고하게 되는 수치가 공급사가 정리한 자료가 아니라 이용자가 만든 게시물에서 나오는 경우가 있습니다.
MiMo 비교는 한 이용자가 검색 도구를 이용해 모은 결과였고, Grok 4.7에 대한 평가도 이용자들이 각자 써 본 인상과 작업 유형별 사용 결과를 올린 것입니다. 같은 벤치마크 이름이 붙어 있어도 누가 어떤 환경에서 측정했는지에 따라 확인할 수 있는 범위가 달라집니다.
외부에 공개된 비교 수치를 볼 때는 측정 주체가 공급사인지 이용자인지, 같은 조건에서 다시 확인할 수 있는지를 구분해 확인 항목에 둘 수 있습니다.
사람이 매긴 정답과의 차이를 측정하는 캘리브레이션 벤치마크에서 결정 전용 모델 Jev는 Yes/No 판단 5.0, 다중선택 9.8, 루브릭 평가 19.7의 격차를 기록했고, 95% 정확도 기준에서 Yes/No 질문의 86%를 스스로 처리한다는 평가를 받았습니다①. 이에 대해 일반 LLM에 선택지 중 하나만 1토큰으로 답하게 하면 유사한 성능이 나온다는 반박이 제기됐고②, 오픈소스 프로젝트 hearim은 사전 학습된 로컬 LLM의 prefill, 즉 입력을 미리 처리해 두는 단계와 1토큰만 생성하는 디코딩만으로 Jev 호환 결정 API를 구현했습니다③.
phantom-kv 프로젝트는 모델 가중치를 전혀 수정하지 않고, 약 18MB 크기의 학습된 key/value 텐서를 KV 캐시에 주입해 거부 응답을 해제하는 방식을 공개했습니다. 이 캐시는 어텐션이 기존 대화 기록처럼 읽어들이는 방식으로 작동하며, 언로드하면 모델이 원본과 동일한 상태로 돌아가고 체크포인트 교체나 런타임 후킹은 필요하지 않다고 설명됐습니다④.
모델을 새로 학습시키지 않아도, 입력으로 읽히는 내용과 생성 범위를 바꾸는 것만으로 모델의 쓰임이 달라진 사례입니다.
Jev 사례에서는 전용 모델이 하던 판단을 기존 모델의 출력 길이를 제한하는 방식으로 대신했고, phantom-kv 사례에서는 가중치를 그대로 둔 채 캐시에 넣은 내용만으로 응답 거부 여부가 달라졌습니다. 두 사례 모두 모델 파일 자체는 바뀌지 않은 상태에서 결과가 달라졌다는 점이 공통적으로 확인됩니다.
모델을 도입하거나 점검할 때 모델 이름과 버전만으로 동작이 고정된다고 보기 어렵다는 점을 확인 항목에 둘 수 있습니다. 어떤 입력과 캐시 구성으로 실행되는지까지 함께 볼 필요가 있습니다.
Andrew Ng은 X 게시글에서 AI 발전을 일시정지하면 이익보다 훨씬 큰 해를 초래할 것이라고 주장하면서, 경쟁국들이 속도를 늦추지 않을 것이라는 점과 엔지니어링은 실제 문제를 경험적으로 발견해야 개선할 수 있다는 점을 근거로 들었습니다. 발전을 10년 미루면 안전 관련 문제의 발견과 해결도 그만큼 늦어진다는 논리입니다①.
화제가 된 'AI 샌드박스 탈출' 사건들에 대해서는, OpenAI와 Hugging Face, Google Gemini 사례 모두 완전한 에어갭이 아니라 네트워크 프록시나 인터넷 연결이 남아 있던 방화벽 설정 때문이었다는 반박 글이 공유됐습니다②③.
일부 커뮤니티 글에서는 AI로 인한 인류 멸종 시나리오보다, 허위정보 확산으로 사회적 신뢰와 인프라가 무너지는 시나리오가 더 현실적이라는 의견이 제기됐습니다④.
같은 AI 위험 논의라도 반론이 겨냥하는 대상은 규제 조치, 사고 원인 설명, 위험 시나리오의 우선순위로 서로 다릅니다.
Ng의 주장은 개발 속도를 늦추는 조치가 가져올 결과를 겨냥했고, 탈출 사건 반박은 이미 보도된 사건의 원인 설명이 정확한지를 겨냥했으며, 멸종 시나리오에 대한 의견은 어떤 위험을 먼저 다룰지를 겨냥했습니다. 세 가지는 하나의 질문에 대한 찬반이 아니라 층위가 다른 논점이어서, 'AI 안전 논쟁'이라는 한 묶음으로 읽으면 각 주장이 무엇을 근거로 삼았는지가 가려질 수 있습니다.
파이낸셜타임스는 Anthropic의 기업가치가 2조 달러에 이를 수 있다는 전망이 과장이 아니라고 분석했고, 근거로 Claude 모델의 기업용 수요와 매출 성장세를 들었습니다①.
Huawei는 자국 내 AI 칩 수요가 공급을 초과함에 따라 해외 AI 칩 판매 계획을 보류한 것으로 전해졌습니다②.
같은 '수요'라는 근거가 한쪽에서는 기업가치 전망으로, 다른 쪽에서는 판매 지역을 미루는 결정으로 이어졌습니다.
Anthropic 사례에서 수요는 앞으로의 가치를 설명하는 근거였고, Huawei 사례에서 수요는 이미 공급을 넘어섰다는 이유로 판매 계획을 미루는 근거였습니다. 두 내용은 확인 수준도 달라서, 한쪽은 언론사의 분석이고 다른 한쪽은 전해진 내용이라는 점을 구분해 볼 필요가 있습니다.
본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.
이전글이 없습니다
102조 소상공인 자금, 논의되는 플랫폼 데이터 주권
2026.09.21