본문 바로가기

주메뉴 바로가기

전체메뉴

미디어룸

오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.

로컬 모델 속도는 실행 조건과 함께 공개됐다, 비교 기준 확인이 필요하다

AI 트렌드2026.09.21
AI TREND 2026.09.21  ·  ONE AI 편집장
Daily AI Trend

넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다

01 / 04
결정 헤드 · 경량 추론
같은 결정 헤드 기능을 재현한 결과가 정확도·점수·처리 속도로 나뉘어 제시됐다
WHAT HAPPENED

한 개발자는 토큰을 생성하지 않고 모델 내부의 마지막 상태에서 곧바로 참/거짓을 판별하는 Jev 방식 결정 헤드를 별도 분류 헤드 학습 없이 재현했다며, 기존 LLM에 boolean 검증 프롬프트와 로짓(모델이 각 선택지에 매기는 점수) 비교만 적용해 Qwen3 27B에서 75.3%, Qwen3.6 35B-A3B에서 75.5% 정확도를 얻었고 OpenJev 파인튠보다 높은 수치였다고 밝혔습니다①.

Qwen3.5 4B에 LoRA 파인튜닝을 적용해 typed-decisions 점수를 0.596에서 0.709로 올린 사례가 공개됐습니다②.

ggml 기반 C++ 구현인 laya.cpp는 배치 8 기준 초당 810건 처리로 Python 구현 대비 3배 이상 빠른 결과를 제시했습니다③. Qwen2.5 1.5B에 SwiGLU 프로브를 붙인 AES는 28ms 안에 추론이 끝났다고 밝혔습니다④.

WHAT IT MEANS

같은 판단 기능을 구현했다고 해도 공개된 수치가 가리키는 대상이 서로 달라, 숫자만으로 우열을 비교하기는 어렵습니다.

정확도(%), typed-decisions 점수, 초당 처리 건수, 응답 지연 시간(ms)은 각각 다른 것을 재는 수치이고, 기반이 된 모델과 구현 방식도 사례마다 다릅니다. 추가 학습 없이 기존 모델의 점수만 비교한 방식과 소규모 파인튜닝을 적용한 방식이 함께 제시된 점도 같이 볼 필요가 있습니다. 어느 쪽이 더 낫다고 정리하기 전에, 그 수치가 무엇을 측정한 값인지부터 구분해야 합니다.

출처
Reddit ① ·  ·  ·
02 / 04
양자화 설정 · GPU 구성
로컬 실행 수치가 하드웨어·설정 조건과 함께 공개됐다
WHAT HAPPENED

모델 용량을 줄이는 양자화 방식인 exllamav3(exl3) 3bpw를 적용해 RTX 3090 3장에서 프리필 1500, 디코딩 80tps를 기록했다는 후기가 공유됐습니다①.

RTX 3060 12GB 환경에서 IQ4_XS 양자화를 적용해 Three.js 애니메이션, 리치텍스트 에디터 등 여러 코딩 과제를 시험한 사례도 공유됐습니다②.

한 사용자는 GB10 16대로 구성한 클러스터에서 2.8T 파라미터급 Kimi K3를 구동해 코딩 작업 기준 디코딩 초당 30토큰(최대 38토큰), 프리필 초당 750~910토큰을 달성했다고 밝혔습니다. 커스텀 NCCL 토폴로지와 이중 스위치 구성에서 여러 요청이 동시에 들어와도 앞서 처리한 입력을 저장해 두는 KV 캐시에서 병목 없이 동작했다고 전했습니다③.

총 7.9B·활성 1.3B 규모의 Ling 3.0 tiny는 4.8GB 양자화 버전이 8GB VRAM GPU에 전부 적재돼 CPU 오프로딩 없이 프롬프트를 처리했다는 비교 결과가 공유됐습니다④.

WHAT IT MEANS

로컬에서 공개되는 성능 수치는 모델 자체만의 결과가 아니라, 어떤 장비에서 어떤 설정으로 돌린 결과인지까지 포함된 값입니다.

이번 사례들만 봐도 GPU 3장, GB10 16대 클러스터, 8GB 단일 GPU처럼 조건이 서로 다르고, 제시된 수치도 프리필 처리량, 디코딩 속도, 메모리 적재 가능 여부로 성격이 다릅니다. 모델 용량을 줄이는 양자화 설정에 따라 GPU 한 장에 모델을 전부 올릴 수 있었다는 사례도 함께 제시됐습니다.

사내 검토에서는 공개된 수치를 그대로 기대치로 삼기보다, 자사 GPU 구성과 양자화 설정, 그리고 그 수치가 입력 처리(프리필)인지 응답 생성(디코딩)인지를 함께 확인 항목으로 둘 수 있습니다.

출처
Reddit ① ·  ·  ·
03 / 04
반독점 소송 · 개발 속도
개발 속도를 늦추는 데 대한 문제 제기가 소송과 공개 발언에서 각각 나왔다
WHAT HAPPENED

Anthropic, OpenAI, SpaceX AI, Google이 AI 기술 개발과 출시 속도를 서로 조율하기로 합의했다며 반독점법 위반을 주장하는 소송이 제기됐다는 소식이 공유됐습니다. 현재까지 공개된 내용은 원고 측 주장이며, 사실관계가 법적으로 확정된 단계는 아닙니다①②.

엔비디아의 젠슨 황은 다른 누구와 상관없이 최대한 빠르게 나아가야 한다고 말하며 개발 속도를 강조했습니다③.

WHAT IT MEANS

AI 개발 속도를 늦추는 선택이 안전 논의 안에서만 다뤄지지 않고, 경쟁법 관점의 다툼 대상으로도 제기됐습니다.

한쪽은 기업들이 서로 합의해 속도를 늦췄다는 법적 주장이고, 다른 쪽은 속도를 늦추지 말아야 한다는 산업계 인사의 공개 발언입니다. 두 사안은 근거의 성격이 다르고 서로 직접 연결된 사건도 아니며, 소송 내용은 아직 판단이 내려지지 않았습니다. 지금 확인할 수 있는 것은 개발 속도를 둘러싼 문제 제기가 서로 다른 경로에서 나왔다는 사실까지입니다.

출처
04 / 04
자율 작업 · 평가 방식
실제 작업을 수행한 결과를 근거로 모델을 평가한 사례가 공유됐다
WHAT HAPPENED

한 사용자는 GPT-6 Astra가 컴퓨터 사용 기능으로 게임 STS2를 세이브 스컴이나 인터넷 검색 없이 A0 난이도에서 스스로 완주했다고 전했습니다. 완벽한 플레이는 아니었고 덱이 38장으로 비대해지는 등 비효율도 있었다고 함께 밝혔으며, 개인이 공유한 사용 경험으로 공식 평가 결과는 아닙니다①.

Remote Labor Index에 Fable과 Astra 모델이 추가됐습니다. 이 지표는 6,000시간 이상, 14만 달러 상당의 실제 전문가 작업(게임 개발, 제품 디자인, 데이터 분석 등)을 기준으로 AI의 단일 프롬프트 작업 수행 결과를 인간 전문가가 직접 평가하는 방식입니다②.

WHAT IT MEANS

모델의 능력을 볼 때 점수표뿐 아니라 어떤 작업을, 어디까지, 누구의 판정으로 해냈는지가 함께 제시된 사례가 나왔습니다.

두 사례는 확인 수준이 다릅니다. 한쪽은 개인 사용자가 공유한 플레이 경험이고, 다른 쪽은 실제 전문가 작업을 기준 삼아 사람이 결과를 평가하는 벤치마크입니다. 같은 '작업을 수행했다'는 표현이라도 평가 주체와 다시 확인할 수 있는 정도가 서로 다릅니다.

업무 적용 가능성을 볼 때는 어떤 종류의 작업인지, 한 번의 지시로 끝낸 결과인지 반복 시도를 포함한 결과인지, 그리고 그 결과를 누가 판정했는지를 구분해 확인 항목으로 둘 수 있습니다.

출처

본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.

ONE AI 세미나 신청
구매상담
1688
5000