본문 바로가기

주메뉴 바로가기

전체메뉴

미디어룸

오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.

에이전트 950개가 찾고 실험은 인간 팀이 맡은 분자 기계 발견

AI 트렌드2026.09.24
AI 트렌드

넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다

01 / 07과학 연구 에이전트 · 분자 기계
탐색은 AI 에이전트가, 실험은 인간 팀이 나눠 맡은 발견 사례
WHAT HAPPENED
•

Anthropic은 Claude가 주도한 연구에서 새로운 분자 기계를 발견했다고 발표했으며, 커뮤니티에서는 이를 CRISPR와 유사한 유전자 편집 메커니즘 후보로 소개했습니다①. 이 발견은 Claude 에이전트 950개를 21시간 동안 가동해 방대한 유전체 데이터를 탐색하는 방식으로 이뤄졌습니다②.

•

다리오 아모데이 CEO는 X에서 이번 연구가 생명과학팀이 큰 방향을 정하고, Claude가 문헌과 게놈 데이터를 읽어 주목할 지점을 찾은 뒤 검증 실험을 제안하며, 실제 실험은 인간 팀이 수행하는 구조로 진행됐다고 설명했습니다. 발견된 메커니즘의 정확한 기능과 실용성은 아직 밝혀지지 않았으며, 그는 이를 박사과정 학생 수준의 연구 성과로 평가할 만하다고 언급했습니다③.

WHAT IT MEANS

이번 사례에서 AI 에이전트가 맡은 역할은 대규모 데이터 탐색과 실험 제안이었고, 연구 방향 설정과 실제 실험은 사람이 맡았습니다.

발표에서 강조된 수치는 에이전트 수와 탐색 시간이며, 발견의 가치를 보여줄 기능과 실용성은 아직 확인되지 않은 상태입니다③. 즉 AI가 후보를 찾아내는 단계와 그 후보가 실제로 쓸모 있는지 확인하는 단계는 서로 다른 단계에서 판단된다는 점을 함께 보여줍니다.

02 / 07인간 기준선 · AI 벤치마크
‘인간 기준선을 넘었다’는 결과도 넘어선 범위는 평가마다 달랐다
WHAT HAPPENED
•

Vals AI의 RSI 지표에서는 Opus 5.5가 5개 과제 중 1개에서 인간 기준선을 넘어섰습니다. RSI는 AI가 스스로를 개선하는 능력인 재귀적 자기개선을 가리킵니다①.

•

GPT-6 Astra는 매우 어려운 비전 벤치마크로 소개된 ZeroBench에서 모든 지표에 걸쳐 인간 기준선을 넘어선 결과를 보였습니다②.

WHAT IT MEANS

AI가 인간 기준선을 넘었다는 결과는 같은 표현이라도 어느 범위에서 넘었는지에 따라 의미가 크게 다릅니다.

RSI 지표에서는 전체 5개 과제 중 1개에서, ZeroBench에서는 모든 지표에서 인간 기준선을 넘었습니다. 두 평가는 측정 대상도 자기개선 과제와 시각 인식 과제로 서로 달라, 결과를 하나의 순위처럼 나란히 놓고 비교하기는 어렵습니다.

‘인간을 넘었다’는 성능 발표를 볼 때 전체 과제 중 몇 개에서 넘었는지, 어떤 종류의 과제를 평가했는지를 별도 확인 항목으로 둘 수 있습니다.

03 / 07추론 비용 · 추론 모드
비슷한 능력에 드는 비용, 분기 추세와 세대 비교 모두에서 낮아졌다
WHAT HAPPENED
•

Epoch AI Research 등의 분석에서는 AI 능력 대비 비용이 분기마다 47~50%씩 떨어지고 있는 것으로 제시됐습니다①.

•

GPT-6 Sol은 낮은 추론 모드에서 인텔리전스 지수 34점을 작업당 0.13달러, 27.75초에 기록했습니다. 이전 세대인 GPT-5.6 Sol은 중간 추론 모드에서 39점을 작업당 0.50달러, 125초에 기록했습니다②.

WHAT IT MEANS

이번 자료에서 비용 하락은 ‘더 뛰어난 모델이 나왔다’는 뜻보다 ‘비슷한 수준의 결과를 더 적은 비용으로 얻을 수 있게 됐다’는 뜻에 가깝습니다.

GPT-6 Sol 비교에서도 점수는 34점과 39점으로 차이가 있지만, 작업당 비용과 처리 시간은 크게 줄었습니다②. 답을 내기 전 추론하는 정도를 조절하는 추론 모드가 서로 다르게 적용된 비교인 만큼, 모델 세대와 추론 설정을 함께 놓고 볼 때 비용 변화의 의미가 드러납니다.

04 / 07바이브 코딩 · 생성형 콘텐츠
같은 모델 데모라도 제작 시간과 사용량은 결과물마다 달랐다
WHAT HAPPENED
•

한 사용자는 Claude Opus 5.5로 삶의 목적을 주제로 한 30~60초 분량의 손그림 콜라주 스타일 애니메이션을 자막·음성·음악까지 포함해 단일 프롬프트로 생성했다고 공유했습니다. 작업에는 약 1시간 20분이 걸렸고, 모델 사용료 약 20달러와 NanoBanana 2 등 8개 서비스를 쓴 OpenRouter API 사용료 3.21달러가 들었다고 밝혔습니다①.

•

‘랜턴 축제’ 3D 비주얼 코딩 데모는 약 8시간 만에 완성됐으며, 주간 Claude 20x Max 예산의 13%를 사용한 것으로 공유됐습니다②.

WHAT IT MEANS

커뮤니티에 공유된 AI 제작 데모는 결과물과 함께 제작에 든 시간과 사용량을 봐야 그 의미가 분명해집니다.

두 사례는 작업 시간이 약 1시간 20분과 약 8시간으로 달랐고, 사용량도 달러 금액과 요금제 예산 비율이라는 서로 다른 단위로 제시됐습니다. 모두 개인 사용자가 공유한 사례이므로, 다른 환경에서도 같은 결과를 같은 비용으로 얻을 수 있다는 뜻으로 확대해 보기는 어렵습니다.

05 / 07결정 모델 · 분류기
LLM 대비로 소개된 Jev, 전용 분류기와 비교하자 정확도가 낮았다
WHAT HAPPENED
•

Jev는 정해진 선택지에 대한 확률을 출력하고, 추론 시점에 정의한 레이블을 쓸 수 있는 결정 모델로 소개되고 있습니다. 한 비판 게시글은 이 방식이 제로샷·NLI 분류기, 임베딩 모델, 리랭커가 이미 해온 일과 본질적으로 같으며, Jev의 성능 비교가 주로 자기회귀 방식 LLM을 상대로 이뤄졌다고 주장했습니다①.

•

Banking77 데이터셋 실험 사례에서는 BGE-small 임베딩과 로지스틱 회귀를 조합한 방식이 93.3% 정확도를 기록했고, Jev는 83.2%였습니다①.

WHAT IT MEANS

새 AI 도구의 성능 우위는 무엇과 비교했느냐에 따라 전혀 다르게 보일 수 있습니다.

비판 측은 특정 작업에 특화된 모델이 범용 LLM보다 빠르고 저렴한 것은 당연한 결과라고 봤고, 별도 학습 없이 문장을 분류하는 제로샷 분류기처럼 같은 작업을 해온 전용 방식과 비교한 실험에서는 Jev의 정확도가 더 낮게 나왔습니다①. 비교 대상 선정에 따라 같은 도구의 평가가 갈린 사례로 볼 수 있습니다.

분류·판단형 AI 도구를 볼 때 범용 LLM과의 비교뿐 아니라, 같은 작업을 수행하는 기존 전용 방식과의 비교 결과가 있는지를 확인 항목에 포함할 수 있습니다.

출처
06 / 07로컬 LLM · 추론 속도
같은 로컬 모델의 속도 기록, 하드웨어와 측정 방식이 서로 달랐다
WHAT HAPPENED
•

한 사용자는 Strix Halo 하드웨어에서 Qwen Flash Next(QFN)를 며칠간 실행한 결과, 초당 30~40토큰 생성, 900~1000토큰 프리필 속도를 기록했다고 공유했습니다①.

•

맥 M5 Ultra 96GB 환경에서는 Qwen 3.8 Flash Next를 4개 요청 동시 처리 기준으로 집계했을 때 프리필 초당 3200토큰, 생성 초당 170토큰이 제시됐으며, 전체 1억1200만 토큰 중 89%가 캐시 히트였다는 수치도 함께 공유됐습니다②.

WHAT IT MEANS

같은 모델이라도 커뮤니티에 공유된 속도 수치는 실행 하드웨어와 측정 방식을 함께 알아야 비교할 수 있습니다.

M5 Ultra 사례의 수치는 4개 요청을 동시에 처리한 집계값인 반면, Strix Halo 사례에는 동시 처리 조건이 따로 제시되지 않았습니다. 그래서 두 수치의 차이를 하드웨어 성능 차이로만 읽기는 어렵고, 입력을 먼저 읽어 들이는 프리필 단계와 답을 만들어 내는 생성 단계의 수치도 각각 따로 봐야 합니다.

07 / 07오픈웨이트 · 중국 AI 모델
다운로드 수와 토큰 사용량, 두 지표 모두 중국 오픈웨이트 모델이 앞섰다
WHAT HAPPENED
•

인터커넥츠의 네이선 램버트가 미국 의회에 제출한 서면 증언에 따르면, 2025년 8월부터 허깅페이스에서 집계한 중국 오픈웨이트 모델 다운로드는 약 32억 건으로 미국 모델 16억 건의 2배였습니다①.

•

같은 증언에서 오픈라우터의 오픈모델 트래픽은 1년 사이 주간 1조 토큰에서 80조 토큰으로 늘었으며, 이 가운데 80% 이상이 중국 모델이라고 제시됐습니다①.

WHAT IT MEANS

모델 가중치가 공개돼 직접 내려받아 쓸 수 있는 오픈웨이트 모델 영역에서는, 이번 증언 기준으로 중국 모델의 이용 비중이 미국 모델보다 컸습니다.

다운로드 수는 모델을 내려받은 횟수이고, 토큰 사용량은 서비스에서 실제로 처리된 입력·출력 분량이라 측정 대상이 다릅니다. 두 지표가 같은 방향을 보였다는 점은 확인되지만, 집계 플랫폼과 기간이 서로 달라 하나의 증가율이나 점유율로 합쳐 볼 수는 없습니다.

출처

본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.

ONE AI 세미나 신청
구매상담
1688
5000