본문 바로가기

주메뉴 바로가기

전체메뉴

미디어룸

오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.

학습 중 프리뷰부터 형식 증명까지, 확인 수준이 갈린 AI 성과

AI 트렌드2026.10.07
AI 트렌드

넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다

01 / 05Mistral Large 4 · 프리뷰 벤치마크
Mistral Large 4의 비교 점수는 학습이 끝나지 않은 프리뷰에서 먼저 나왔다
WHAT HAPPENED
•

Mistral AI가 Mistral Large 4를 프리뷰 형태로 공개했으며①, 공개된 벤치마크에서는 터미널 환경 작업을 평가하는 Terminal-Bench 점수가 Qwen 3.8 Max와 Kimi K3보다 높게 나타났습니다②. 규제·법률 관련 벤치마크에서도 높은 결과가 공유됐습니다③.

•

개발 관계자는 X를 통해 Mistral Large 4가 아직 강화학습(RL) 훈련을 이어가고 있으며, 프리뷰 이후에도 성능 개선이 계속 관측되고 있다고 밝혔습니다④.

•

모델 가중치를 내려받아 직접 사용할 수 있는 오픈 웨이트 공개는 약 25일 뒤로 예정돼 있다는 내용이 공유됐습니다⑤.

WHAT IT MEANS

이번에 공개된 Mistral Large 4의 경쟁 모델 대비 점수는 학습이 끝난 최종 모델이 아니라 훈련이 진행 중인 프리뷰 단계에서 나온 결과입니다.

개발 측이 강화학습 훈련과 성능 개선이 계속되고 있다고 밝힌 만큼, 현재 점수는 고정된 값이라기보다 공개 시점의 결과에 가깝습니다. 가중치를 직접 내려받아 사용하는 단계도 아직 공개 전이어서, 점수가 먼저 나오고 모델 확정과 배포가 그 뒤를 잇는 순서로 진행되고 있습니다.

프리뷰 단계 모델의 수치를 다른 모델과 비교할 때는 그 결과가 어느 시점의 어떤 버전에서 나온 것인지를 별도 확인 항목으로 둘 수 있습니다.

02 / 05Qwen3.8-Flash-Next · 실사용 평가
Qwen3.8-Flash-Next, 무엇을 재느냐에 따라 사용자 평가가 달랐다
WHAT HAPPENED
•

RTX6000 GPU에서 모델 용량을 줄이는 NVFP4 양자화와 MTP3 디코딩 설정을 적용한 사용자 테스트에서는 최대 400 tok/s의 생성 속도와 13,900 tok/s의 프리필(입력 처리) 속도가 공유됐습니다①.

•

Strix Halo 노트북에서 Claude Opus 5.5와 코딩 결과를 비교한 사용자 사례에서는 Qwen3.8-Flash-Next가 더 많은 테스트 케이스와 예외 상황(엣지 케이스)을 처리했다는 평가가 나왔습니다②.

•

실사용 워크플로우를 비교한 사례에서는 Qwen3.8-27B 밀집 모델이 2회의 수정 반복으로 결과를 완성한 반면 Flash-Next는 5회가 필요했고, Flash-Next의 리뷰 코멘트가 장황하고 토큰 소비가 많다는 비판이 제기됐습니다③.

WHAT IT MEANS

같은 모델이라도 처리 속도, 테스트 처리 범위, 실제 작업을 완성하기까지의 수정 횟수 중 무엇을 기준으로 보느냐에 따라 평가가 달라졌습니다.

이번 결과들은 모두 특정 하드웨어·설정·작업에서 나온 개별 사용자 사례입니다. 한 테스트에서는 높은 처리 속도나 많은 테스트 케이스 처리가 기록됐지만, 다른 작업 흐름에서는 수정 반복 횟수와 토큰 소비가 문제로 지적됐습니다. 각 결과가 서로 다른 항목을 잰 것이어서 하나의 우열로 합쳐 읽기는 어렵습니다.

모델을 비교할 때 처리 속도, 결과물 완성까지의 수정 횟수, 토큰 소비량을 하나의 점수로 묶지 않고 별도 항목으로 나눠 보는 것을 판단 기준으로 둘 수 있습니다.

03 / 05AI 수학 · 형식 검증
AI가 만든 수학 증명, 형식 검증과 저자 해설로 뒷받침 방식이 나뉘었다
WHAT HAPPENED
•

Astra와 Claude가 정사각형 11개의 최적 패킹 문제에서 기존에 알려진 최선의 배치가 실제로 최적임을 증명했으며, 이 증명은 증명 검증 도구인 Lean으로 형식 검증됐다는 사례가 공유됐습니다①.

•

31년간 완성되지 못했던 효율적 컴퓨터 탐색·샘플링 관련 증명 문제에서는 ChatGPT가 핵심 아이디어와 증명 대부분을 도출했고, 저자들은 이를 이해하고 설명하는 역할을 주로 맡았다고 밝혔습니다②.

WHAT IT MEANS

'AI가 수학 문제를 풀었다'는 같은 문장이라도, 그 결과를 무엇이 뒷받침하는지는 사례마다 다릅니다.

한 사례는 컴퓨터가 증명의 각 단계를 기계적으로 확인하는 형식 검증을 거쳤고, 다른 사례는 AI가 도출한 증명을 사람 저자들이 이해하고 설명하는 방식으로 정리됐습니다. 두 사례 모두 AI가 증명의 핵심을 만들었지만, 결과를 받아들이는 근거는 기계적 검증과 연구자의 해설이라는 서로 다른 경로에 놓여 있습니다.

04 / 05Looped Transformer · 추론 패스
GPT-6의 반복 연산 구조, 유출 정보와 삭제된 문구로 추정이 이어졌다
WHAT HAPPENED
•

GPT-6 계열은 토큰 하나를 출력할 때 같은 가중치를 여러 번 반복 통과시키는 looped transformer 구조라는 추정이 이어져 왔으며, Azure Foundry에서 유출된 것으로 알려진 정보에는 GPT-6-Sol이 토큰당 3회, GPT-6.1-Sol이 2회의 추론 패스를 사용한다는 내용이 담겼습니다①.

•

글 작성자는 Artificial Analysis 속도 데이터에서 GPT-6-Sol이 초당 약 100토큰, GPT-6.1-Sol과 GPT-6-Astra가 초당 약 60토큰으로 나타난 점을 패스 수 차이와 맞아떨어지는 패턴이라고 제시했습니다①.

•

이후 마이크로소프트 공개 웹페이지에 GPT-6.1 Sol이 '3회 대신' 2회의 추론 패스를 사용한다는 문구가 기재됐다가, 해당 문구가 페이지에서 삭제됐다는 내용이 공유됐습니다②.

WHAT IT MEANS

이번 사례에서 GPT-6 계열의 내부 구조는 개발사의 설명이 아니라 유출 정보, 외부 속도 측정값, 마이크로소프트 페이지 문구를 이어 맞추는 방식으로 추정됐습니다.

looped transformer는 같은 가중치를 반복 사용해 모델의 처리 깊이를 늘리는 방식으로, 이번 논의에서는 토큰당 몇 번 반복하느냐가 모델 간 차이로 거론됐습니다. 근거가 된 자료는 유출 정보와 이후 삭제된 문구, 커뮤니티의 속도 데이터 해석이며, 원천 자료에는 OpenAI의 직접 설명이 포함돼 있지 않습니다.

05 / 05EmbeddingGemma 2 · 멀티모달 임베딩
텍스트와 이미지를 함께 다루는 임베딩 모델이 브라우저 안에서 구동됐다
WHAT HAPPENED
•

구글이 공개한 EmbeddingGemma 2는 텍스트와 이미지 등 여러 형태의 데이터를 의미에 따라 비교할 수 있는 하나의 임베딩 공간에서 처리하는 멀티모달 오픈 모델로①, Hugging Face를 통해 누구나 내려받을 수 있게 공개됐습니다②.

•

브라우저에서 GPU 연산을 쓰게 하는 WebGPU 기반 데모에서는 이 모델을 별도 서버 없이 브라우저 안에서 로컬로 구동하는 사례가 공유됐습니다③.

WHAT IT MEANS

이번 EmbeddingGemma 2 사례에서는 텍스트와 이미지를 한 기준으로 비교하는 임베딩 생성이 서버가 아닌 사용자 기기의 브라우저 안에서도 이뤄질 수 있음이 시연됐습니다.

임베딩은 데이터를 의미에 따라 비교할 수 있는 숫자 형태로 바꾸는 과정입니다. 모델을 내려받을 수 있게 공개한 것과 브라우저 구동 데모가 함께 제시되면서, 이 과정을 어디에서 처리할지가 서버에 한정되지 않는 선택지로 나타났습니다.

본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.

ONE AI 세미나 신청
구매상담
1688
5000