본문 바로가기

주메뉴 바로가기

전체메뉴

미디어룸

오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.

AI 주도 연구 비중이 자체 집계로 공개됐다, 검증 주체 확인이 먼저다

AI 트렌드2026.09.18
AI TREND 2026.09.18  ·  ONE AI 편집장
Daily AI Trend

넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다

01 / 04
모델 최적화 · 오픈 모델
같은 기반 모델에서 용량과 토큰 사용을 줄이는 최적화가 각각 공개됐다
WHAT HAPPENED

Qwen3.8-27B를 기반으로 가중치를 세 값으로만 표현하는 삼진법(ternary) 방식의 'Ternary Bonsai 2 27B'가 공개됐습니다. 공개 설명에 따르면 FP16 기준보다 9배 작은 6GB 미만 크기로 지능의 98.2%를 유지하며, 브라우저에서 WebGPU로 실행할 수 있다고 제시됐습니다①②.

같은 기반 모델에서 답을 지나치게 길게 생각하는 오버씽킹 패턴을 억제한 'Swift Qwen 3.8 27B'는 토큰 사용량을 58.3% 줄이고 속도를 1.95배 높였다고 밝혔습니다. 이 모델은 허깅페이스 트렌딩 9위와 파인튜닝 1위에 올랐고 다운로드 10만 건을 넘어섰습니다③.

WHAT IT MEANS

같은 기반 모델을 가볍게 만들었다고 해도 실제로 줄인 대상은 서로 다릅니다. 한쪽은 모델을 저장하고 올리는 데 필요한 파일 용량을 줄였고, 다른 쪽은 답을 만드는 과정에서 쓰는 글자 단위인 토큰 사용량을 줄였습니다.

줄인 대상이 다르면 함께 제시된 조건도 다릅니다. Ternary Bonsai 2 27B는 크기와 함께 브라우저 실행 가능 여부가, Swift Qwen 3.8 27B는 토큰 사용량과 속도 배수가 제시됐습니다. 두 결과를 하나의 경량화 성과로 묶어 비교하기는 어렵고, 자사 환경에서 줄여야 하는 것이 저장·구동 조건인지 응답 생성량인지를 먼저 구분해 볼 필요가 있습니다.

출처
02 / 04
특화 모델 · 평가 범위
작업 범위를 좁힌 소형 모델이 각자의 전용 평가에서 상위 점수를 기록했다
WHAT HAPPENED

기기 자체에서 구동하는 자동화 전용 모델 'Cactus Needle 3'가 공개됐습니다. 파라미터 121M에 8~29MB 크기이며, 대화 기능을 빼고 함수 호출과 구조화된 정보 추출로 범위를 좁혔습니다. 모바일 명령어 벤치마크에서는 86.0점을 기록해 LFM2.5 1.2B의 82.4점, Qwen3.5 0.8B의 76.0점보다 높은 점수가 제시됐습니다①.

텐센트는 Qwen3-VL을 파인튜닝한 문서 파싱 전용 모델 'WeVisDoc'을 공개했고, 문서 인식 평가인 OmniDocBench v1.6에서 95.38점으로 비교 모델 가운데 1위를 기록했다고 밝혔습니다②.

WHAT IT MEANS

모델을 고를 때 크기가 클수록 낫다는 기준이 모든 작업에 그대로 적용되지는 않습니다. 이번 두 모델은 다루는 작업 범위를 좁힌 상태에서, 그 작업을 겨냥한 평가에서 상위 점수를 받았습니다.

다만 두 점수는 서로 다른 평가에서 나온 값입니다. Cactus Needle 3는 모바일 명령어 수행이라는 좁은 과제에서 파라미터가 더 많은 모델보다 높은 점수가 제시됐고, WeVisDoc은 문서 인식 평가 안에서 비교 모델 중 1위로 제시됐습니다. 두 값을 나란히 놓고 어느 모델이 더 낫다고 말하기는 어렵습니다.

또한 Cactus Needle 3는 대화 기능을 빼는 조건에서 자동화 작업 점수를 얻었습니다. 특화 모델 도입을 검토할 때는 점수 자체보다 그 평가가 우리 업무와 같은 범위를 재고 있는지, 제외된 기능이 실제 업무에 필요한지를 함께 확인 항목에 둘 수 있습니다.

출처
03 / 04
개발 자동화 · 자체 집계
AI의 개발 관여 비중과 결과 성능이 개발사 자체 자료로 각각 공개됐다
WHAT HAPPENED

Anthropic은 자사 블로그를 통해 내부 연구개발 가운데 Claude가 주도하는 비중이 6개월 전 거의 0%에서 현재 26%까지 올랐다고 밝혔습니다①.

Anthropic은 Claude가 직접 작성한 GPU 최적화 코드를 오픈소스로 공개했고, 30개 이상의 생물분자 모델에 적용한 결과 평균 약 4배의 속도 향상이 확인됐다고 제시했습니다②.

중국 AI 기업 GLM은 자사 모델을 활용해 모델을 서비스하는 추론 인프라를 직접 구축한 과정을 공개했습니다③.

WHAT IT MEANS

AI가 개발 업무에 얼마나 관여했는지를 보여주는 자료가 나왔지만, 공개된 값들은 서로 다른 것을 재고 있습니다. 하나는 연구 업무 중 AI가 주도한 비중이고, 다른 하나는 AI가 작성한 코드에서 확인된 속도 개선 폭입니다.

관여 비중이 높다는 것과 결과물의 성능이 좋다는 것은 같은 지표가 아닙니다. 26%는 업무 가운데 AI가 주도한 범위를, 약 4배는 특정 모델군에 적용했을 때 나온 속도 결과를 가리킵니다. GLM 사례는 인프라를 구축한 과정이 공개된 것이며, 성과 수치가 함께 제시된 것은 아닙니다.

세 자료 모두 개발사가 스스로 공개한 것이고, 외부 기관이 같은 조건에서 다시 확인한 결과는 아닙니다. 사내에서 AI 개발 도구의 효과를 검토할 때는 공개된 값이 관여량인지 결과 성능인지, 측정 주체와 적용 범위가 어디까지인지를 구분해 확인 항목에 둘 수 있습니다.

출처
04 / 04
실환경 과제 · 근거 형태
실제 생활 환경의 작업 수행 결과가 성공률과 시연 영상으로 각각 제시됐다
WHAT HAPPENED

실제 스마트폰에서 60개 작업을 수행하는 AndroidLife 벤치마크에서 56.7%의 성공률로 텍스트 모델 가운데 가장 높은 점수가 기록됐다는 결과가 공유됐습니다①.

Figure의 창업자 브렛 애드콕은 자사 휴머노이드 로봇이 30개 임대 주택에서 해당 가정을 별도로 학습하지 않은 제로샷 상태로 물건 정리와 이동 등 가사 작업을 수행하는 4시간 분량의 영상을 공개했습니다②③.

WHAT IT MEANS

AI의 작동 결과를 정해진 문제 세트가 아니라 실제 생활 환경의 작업으로 보여준 자료가 함께 나왔습니다. 다만 같은 실제 환경이라도 결과가 제시된 형태는 서로 다릅니다.

한쪽은 60개 작업 중 56.7% 성공이라는 수치여서 성공하지 못한 비중까지 함께 읽을 수 있고, 다른 쪽은 제조사가 공개한 영상이어서 몇 번 시도해 얼마나 성공했는지는 공개된 범위에서 확인되지 않습니다. 실제 환경에서 작동했다는 설명을 볼 때는 시도 횟수와 성공 비율이 함께 제시됐는지, 결과를 공개한 주체가 누구인지를 구분해 볼 필요가 있습니다.

출처

본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.

ONE AI 세미나 신청
구매상담
1688
5000