본문 바로가기

주메뉴 바로가기

전체메뉴

미디어룸

오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.

프롬프트·입력 길이·동시 접속에 따라 달라진 로컬 LLM 속도

AI 트렌드2026.10.02
AI 트렌드

넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다

01 / 05로컬 LLM · 추론 속도
로컬 LLM 속도 수치, 어떤 조건에서 쟀느냐에 따라 크게 갈렸다
WHAT HAPPENED
•

Qwen3.8-27B를 구동하는 추론 엔진 Gufo가 내세운 70tps는 같은 단어를 1000번 반복하는 특수 프롬프트에서 나온 수치였으며, 코딩·요약 같은 일반 프롬프트에서는 1명 사용 시 39.4 tok/s, 8명 동시 사용 시 52 tok/s 수준이라는 검증 글이 올라왔습니다①.

•

RTX 3090 한 장에서 Qwen3.8-27B를 모델 용량을 줄이는 양자화 설정인 Q4_K_M으로 실행한 실험에서는 입력 길이에 따라 생성 속도가 36.4 tok/s에서 20.9 tok/s로 떨어지는 현상이 확인됐다는 결과가 공유됐습니다②.

•

추론 엔진 FreeToken과 llama.cpp를 비교한 글에서는 여러 전문가 모듈 중 일부만 사용하는 MoE 모델이 그래픽카드 메모리(VRAM)에 모두 들어가는 조건에서는 llama.cpp가 2~3배 빠르지만, gpt-oss-120b처럼 큰 모델에 32명이 동시 접속하는 조건에서는 FreeToken의 첫 토큰 응답이 7배 빠르다는 결과가 제시됐습니다③.

WHAT IT MEANS

로컬 LLM의 속도 수치는 숫자 하나만으로 비교하기 어렵고, 어떤 프롬프트·입력 길이·동시 사용 조건에서 측정했는지가 함께 있어야 의미를 가집니다.

Gufo 사례에서는 특수 프롬프트와 일반 프롬프트 사이의 수치 차이가 컸고①, FreeToken 비교에서는 모델이 메모리에 모두 들어가는지와 동시 접속 수에 따라 어느 엔진이 앞서는지가 달라졌습니다③. 같은 장비·같은 모델에서도 입력 길이에 따라 생성 속도가 달라졌습니다②. 즉 공개된 속도 수치에는 모델과 엔진 자체의 특성뿐 아니라 측정 환경이 함께 반영될 수 있습니다.

로컬 구동 사례를 참고할 때는 측정에 쓴 프롬프트 종류, 입력 길이, 동시 요청 수를 확인하고, 제시된 수치가 초당 생성 속도인지 첫 응답까지 걸린 시간인지를 구분해 비교 항목으로 둘 수 있습니다.

02 / 05Gemini 4 Argon · 출력 한도
출력 분량 한도가 모델 간 차이를 보여주는 항목으로 거론됐다
WHAT HAPPENED
•

Google이 공개한 Gemini 4 Argon은 최대 100만 토큰(약 1400페이지) 분량의 출력을 지원하며, 함께 비교된 Opus 5.5와 Astra는 12만8000~30만 토큰(약 90~180페이지) 수준으로 제시됐습니다①.

•

커뮤니티에서는 이 출력 한도가 긴 작업을 여러 번 나눠 처리하거나 'continue' 프롬프트를 반복 입력해야 하는 '컨텍스트 글루' 문제를 해결하는 분기점이 될 수 있다는 기대가 나왔으며, 대규모 코드 마이그레이션·보안 패치·심층 추론 작업에 유리할 것이라는 평가도 공유됐습니다②.

WHAT IT MEANS

출력 한도는 모델이 한 번의 응답으로 만들어낼 수 있는 결과물의 분량을 뜻하며, 이번 사례에서는 이 수치가 긴 작업을 나누지 않고 처리할 수 있는지와 연결돼 평가됐습니다.

출력 한도는 한 번에 처리할 수 있는 입력량인 컨텍스트 길이와는 다른 항목입니다. 공개된 수치는 경쟁 모델과의 출력 분량 차이를 보여주고①, 커뮤니티의 기대는 그 차이를 작업 분할의 번거로움을 줄이는 문제로 연결했습니다②. 다만 후자는 사용자들의 기대와 평가로, 긴 출력에서 실제 결과물의 품질이 어떻게 나오는지는 이번 자료에서 확인되지 않습니다.

03 / 05오픈 모델 · 파인튜닝
연구기관과 개인 개발자 모두 모델 학습 과정을 세부 조건까지 공개했다
WHAT HAPPENED
•

Institute of Foundation Models(IFM)는 0.9B부터 375B까지 크기가 다른 6종의 완전 오픈 모델 K2 Horizon을 공개했습니다. 학습으로 정해진 모델의 내부 값인 가중치뿐 아니라 학습 데이터, 학습 레시피, 코드, 중간 체크포인트, 세부 학습 로그와 평가 결과까지 공개했으며, 연구팀은 사전학습·데이터 구성·후속학습·온디바이스 소형 모델 등을 주제로 한 공개 질의응답(AMA)을 예고했습니다①.

•

한 개인 개발자는 Yandex의 AliceAI-80B-A3B 모델을 기반으로 어텐션과 공유 전문가(shared expert)만 학습시키고 기존 전문가는 동결하는 방식으로 지시 수행형(instruct) 파인튜닝을 진행했으며, V100 GPU 3대로 약 48시간 만에 학습을 완료했다고 공유했습니다②.

WHAT IT MEANS

이번 두 사례에서는 모델을 어떤 데이터와 방법, 자원으로 학습시켰는지가 공개 내용에 구체적으로 담겼습니다.

K2 Horizon은 연구기관이 학습 데이터와 학습 기록 전반을 공개한 사례이고①, AliceAI 파인튜닝은 개인 개발자가 모델의 일부 구성 요소만 학습시키는 방식과 GPU 대수·학습 시간을 공유한 사례입니다②. 공개 주체와 규모는 다르지만, 두 사례 모두 성능 결과만이 아니라 학습 과정 자체를 다른 사람이 확인할 수 있는 형태로 내놓았다는 점이 같습니다.

오픈 모델을 비교할 때 가중치 공개 여부와 학습 데이터·레시피·학습 기록 공개 여부를 서로 다른 항목으로 구분해 볼 수 있습니다.

04 / 05대화형 AI · 튜링테스트
영상·음성 AI가 '사람과 얼마나 비슷한가'를 기준으로 평가됐다
WHAT HAPPENED
•

Human Interaction Model인 Griffin이 영상 튜링테스트를 통과한 첫 사례로 소개됐습니다. 말하기와 듣기를 동시에 처리하는 NVIDIA의 풀더플렉스 AI 영상 벤치마크에서 1위를 차지했으며, 실험 참가자의 44%가 Griffin을 실제 사람으로 착각한 반면 다른 경쟁 시스템은 이 비율이 약 3%였다고 전해졌습니다①.

•

한 레딧 이용자는 몇 달 만에 다시 사용한 ChatGPT 음성모드가 사람과 대화하는 듯 자연스러워졌다고 전하며, 몇 년 전에는 적절히 끊어 말하는 것조차 어려웠다고 비교했습니다②.

WHAT IT MEANS

이번 두 사례에서 영상·음성 AI는 '사람과 대화하는 것처럼 느껴지는가'라는 기준으로 평가됐습니다.

같은 기준이라도 평가가 나온 방식은 다릅니다. Griffin은 실험 참가자 가운데 사람으로 착각한 비율이라는 수치로 제시됐고①, ChatGPT 음성모드는 한 사용자가 이전 사용 경험과 비교한 체감 평가입니다②. 사람과 비슷하다는 평가가 참가자 실험에서 나왔는지 개인 경험에서 나왔는지에 따라, 그 평가를 넓혀 적용할 수 있는 범위도 달라집니다.

05 / 05AI 위험 논쟁 · 실존적 위험
AI 멸종 위험을 낮게 본 주장들, AI 능력을 보는 시각은 엇갈렸다
WHAT HAPPENED
•

Meta의 수석 AI 과학자였던 얀 르쿤은 AI로 인한 인류 멸종 가능성에 대해 전혀 우려하지 않는다는 입장을 다시 밝혔습니다. 그는 현재 AI 시스템이 진정한 추론 능력이나 세상이 어떻게 작동하는지에 대한 내부 이해인 세계 모델을 갖추지 못했으며, 따라서 통제 불능으로 치닫는 재앙적 시나리오는 과장된 공포라는 입장을 유지하고 있습니다①.

•

한 레딧 게시글은 AI로 인한 멸종 위험은 낮다고 보면서도, 세상의 변화가 많은 사람에게 디스토피아처럼 느껴질 수 있다는 어려운 과제를 지적했습니다. 이 글은 '닷컴 버블', 'LLM은 확률적 앵무새일 뿐', '다 마케팅이다' 같은 시각을 가진 'AI 부정론자'가 초지능 전환을 받아들이는 '서세셔니스트'보다 담론에 더 위험하다고 주장했습니다②.

WHAT IT MEANS

AI 멸종 위험을 낮게 본다는 결론이 같아도, 그 판단의 바탕이 되는 AI 능력에 대한 시각은 서로 달랐습니다.

르쿤은 현재 AI가 진정한 추론과 세계 모델을 갖추지 못했다는 점을 근거로 재앙적 시나리오를 과장으로 봤습니다①. 반면 레딧 게시글은 AI를 '확률적 앵무새'로 보는 시각 자체를 문제로 삼으면서, 우려의 초점을 멸종이 아닌 사회 변화가 주는 부담에 뒀습니다②. 따라서 'AI 위험이 낮다'는 같은 입장 안에도 AI가 아직 충분히 강하지 않다는 판단과, 변화는 크지만 멸종으로 이어질 가능성은 낮다는 판단이 함께 들어 있을 수 있습니다.

본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.

ONE AI 세미나 신청
구매상담
1688
5000