오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.
미국 정부가 지지한 AI 학습 합법론, 콘텐츠 보호 기준이 쟁점이 됐다
넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다
알리바바의 Qwen3.8-Max-0902가 코딩 벤치마크 Code Arena: WebDev에서 Claude Opus 5를 제치고 1 위에 올랐습니다.
Qwen3.8-Max-0902가 Code Arena: WebDev 종합 순위에서 1691점으로 1위를 차지했습니다. 이는 Claude Opus 5(Max)보다 3점, Kimi K3(Max)보다 17점 높은 점수이며, 이전 버전 Qwen3.8-Max보다도 22 점 상승한 결과입니다. 가격은 블렌디드 기준 100만 토큰당 5달러로 책정되어 성능 대비 가격 경쟁력도 주목받고 있습니다.
한편 로컬 커뮤니티에서는 Qwen3.8-Flash-Next 같은 경량 파생 모델도 활발히 테스트되고 있으며, 일부 사용자는 컨텍스트 내 텍스트가 깨지는 듯한 현상을 보고했지만 모델이 스스로 오류를 인지하고 복구를 시도하는 모습이 인상적이라는 반응도 있었습니다. 또한 N-gram 레이어 정밀도를 Q8로 교체해도 속도 저 하가 거의 없다는 실험 결과와, Mac M5에서 llama.cpp의 Metal 지원 개선으로 MLX 없이도 충분한 프리필 성능을 낼 수 있다는 보고도 함께 공유됐습니다.
중국 오픈소스 모델이 최상위 폐쇄형 모델인 Claude Opus 5를 코딩 벤치마크에서 앞선 것은 오픈소스와 상용모델 간 격차가 더욱 좁혀지고 있음을 보여줍니다. 저렴한 가격과 로컬 실행 가능성까지 더해져 개발자들의 모델 선택 기준이 성능뿐 아니라 비용과 접근성으로 확장되고 있습니다.
Meta가 새 모델 Muse Spark 1.3을 출시하며 경쟁 모델인 Fable 5와 GPT 5.6 Sol을 앞섰다고 주장했고, 오픈웨이트 공개도 예고했습니다.
Meta가 Muse Spark 1.3을 공개했고, 커뮤니티에서는 이 모델이 Artificial Analysis 벤치마크에서 Fable 5와 GPT 5.6 Sol을 능가했다는 반응이 나오고 있습니다. 이는 Meta가 최근 경쟁 모델들에 뒤처졌다는 평가를 받던 상황에서 다시 격차를 좁히고 있다는 신호로 해석되고 있습니다.
또한 Meta 관계자로 추정되는 X(트위터) 계정을 통해 Muse Spark의 오픈웨이트 공개가 예고되었으며, 일부 사용자는 이를 두고 Llama 5나 Glimmer와 Spark 사이 크기의 모델을 기대하고 있습니다. 한편 Gemini Flash 3.8, Grok 4.7 등 경쟁 모델들도 비슷한 시기에 코딩 성능 면에서 유사한 수준에 도달하고 있다는 관측이 함께 제기되고 있습니다.
여러 회사의 모델들이 코딩 등 핵심 성능 지표에서 비슷한 수준으로 수렴하고 있다는 점은 모델 간 차별성이 줄어들고 있음을 보여줍니다. Meta의 오픈웨이트 공개 예고는 오픈소스 생태계 경쟁에도 다시 활력을 불어넣을 수 있는 요소로 주목받고 있습니다.
Google이 Gemini 3.8 Flash와 3.8 Flash Cyber를 출시했지만, 벤치마크 점수가 실제 성능보다 과장되었다는 '벤치맥싱' 의혹이 커뮤니티에서 제기되고 있습니다.
Google이 경량 모델 라인업인 Gemini 3.8 Flash와 보안 특화 버전인 3.8 Flash Cyber를 공개했습니다. Artificial Analysis 등 외부 벤치마크 사이트에 공개된 초기 점수는 동급 경쟁 모델들을 상회하는 수준으로 나타나, 처음에는 성능 도약으로 주목받았습니다. 그러나 실사용 후기가 쌓이면서 커뮤니티에서는 해당 점수가 벤치마크 문항에 맞춰 특화 학습된 결과일 뿐, 실제 추론 능력이나 범용 작업 처리 능력과는 차이가 크다는 지적이 이어지고 있습니다. 특히 벤치마크 밖의 새로운 문제나 복잡한 코딩 과제에서는 기대에 못 미치는 결과가 나온다는 사례가 다수 공유되며 '벤치맥싱(benchmaxxing)'이라는 표현이 확산되고 있습니다.
AI 모델 평가에서 벤치마크 수치의 신뢰성 자체가 도전받고 있다는 점에서 업계 전반에 시사점을 줍니다. 벤치마크 점수와 실사용 체감 성능 사이의 격차가 반복적으로 드러나면서, 향후 모델 평가 방식과 검증 기준에 대한 재검토 요구가 커질 것으로 보입니다.
OpenAI의 차세대 모델 'GPT-6-ASTRA'가 API에 노출되며 출시가 임박했다는 소식이 전해진 가운데, 일리야 서츠케버가 신경어(neuralese)와 사고과정 모니터링 투명성 문제를 공개적으로 언급하며 논쟁이 확산되고 있습니다.
OpenAI API에서 'GPT-6-ASTRA'라는 이름의 모델이 발견되면서 커뮤니티에서 신모델 출시가 임박했다는 기대가 커지고 있습니다. 샘 올트먼도 X를 통해 "곧 다음 모델을 출시할 예정"이라며 "분명한 긴장이 존재하지만 Astra는 매우 훌륭하고, 우리는 이 작업을 자랑스럽게 생각한다"고 밝혔습니다. 한편 OpenAI의 수석 과학자는 최근 불거진 신경어(neuralese) 논�란에 대해 직접 해명을 내놓았습니다. 그는 Astra를 포함한 현재 프론티어 모델들의 연산 그래프 깊이가 GPT-4와 비교해 2배 이내 수준이라고 밝히며, 아키텍처 변화로 인해 모니터링이 어려워졌다는 일부 보도가 오해에 기반한 것이라고 설명했습니다.
다만 사고과정(chain-of-thought) 모니터링 기법 자체는 여전히 취약하며 부정적인 방향으로 흘러가고 있다고 인정하면서, 이를 강화하는 것이 현재 연구 프로그램의 핵심 목표라고 강조했습니다. 이와 함께 일리야 서츠케버도 이례적으로 로그 AI 모델에 대한 보안 문제를 다루는 글을 게시하며 관련 논의에 힘을 더했습니다.
신모델 성능 경쟁 이면에서 AI 내부 사고과정을 인간이 감시할 수 있는지가 핵심 안전 이슈로 떠오르고 있습니다. 모니터링 불가능성으로의 '경쟁'을 막아야 한다는 발언은 향후 AI 개발 방향에 안전성 기준이 어떻게 반영될 지를 시사합니다.
미국 정부가 OpenAI와 뉴욕타임스 간 저작권 소송에서 AI 학습이 저작권 침해가 아니라는 입장을 공식적으로 지지했습니다.
미국 정부가 OpenAI와 뉴욕타임스 사이의 저작권 소송에 의견서를 제출하며 OpenAI의 편을 들었습니다. 핵심 주장은 AI 모델이 저작물을 학습 데이터로 사용하는 행위 자체가 저작권 침해에 해당하지 않는다는 것입니다. 이는 뉴욕타임스가 제기한 소송의 핵심 쟁점, 즉 GPT와 같은 모델이 뉴욕타임스 기사를 학습에 활용한 것이 불법 복제라는 주장을 정면으로 반박하는 입장입니다. 정부의 이 같은 개입은 AI 기업들이 저작권 있는 콘텐츠를 학습 데이터로 사용하는 관행에 법적 정당성을 부여하는 신호로 해석되고 있습니다. 레딧 등 커뮤니티에서는 이번 결정이 콘텐츠 창작자들에게 불리한 전례가 될 것이라는 우려의 목소리가 나오고 있습니다.
정부 차원의 이번 지지는 향후 AI 학습 데이터 관련 저작권 소송들의 판결 방향에 큰 영향을 미칠 수 있습니다. AI 학습이 침해가 아니라는 원칙이 법적으로 확립되면 언론사와 창작자들의 콘텐츠 보호 수단이 크게 약화될 가능성이 있습니다.
AGI 도달 시점을 둘러싼 낙관론과 비관론이 동시에 확산되면서, 예측가들의 신뢰도와 로봇공학·초고속 AI가 가져올 사회 변화에 대한 논쟁이 커지고 있습니다.
OpenAI의 그렉 브록먼이 TIME과의 인터뷰에서 진정한 AGI에 얼마나 근접했는지를 논하며 화제가 됐습니다. 동시에 AI 2027 보고서를 작성한 다니엘 코코타일로와 비관론자로 유명한 에드 지트론의 예측 정확도를 비교분석한 글이 주목받았는데, 이 분석에 따르면 지트론은 OpenAI의 매출 전망을 "입 밖으로 꺼내면 금융 범죄급"이라 비판했지만 실제로는 그 수치가 달성됐다는 점이 지적됐습니다. 또한 커즈와일처럼 극단적 낙관론자와 지트론 같은 극단적 비관론자 모두 확신에 찬 예측을 반복하지만, 실제로는 진행 속도가 빠르지도 멈추지도 않는 중간 지점에 머물러 있다는 지적이 나왔습니다.
한편 로봇공학이 LLM만큼 주목받지 못하지만 2018~2019 년 LLM 수준의 초기 발전 단계에 있으며, 5~10년 내 인간 수준 혹은 그 이상의 로봇이 등장할 것이라는 우려도 제기됐습니다. 추론 속도 측면에서는 현재 초당 14000토큰을 처리하는 LLM(ChatJimmy)이 등장했고, OpenAI의 울트라패스트 모드는 사용자 기준 초당 750토큰을 처리하는데, 5년 내 초당 5000토큰 이상의 프론티어 모델이 등장할 것이라는 전망도 나왔습니다.
AGI 도달 시점 예측은 정책·투자·개인의 삶 전략에 직결되는 문제이지만, 극단적 낙관론과 비관론 모두 확증편향과 인플루언서 경제에 의해 왜곡될 위험이 있다는 점이 드러났습니다. 로봇공학과 초고속 AI 추론 속도의 발 전은 권력 구조와 민주주의 자체를 위협할 수 있다는 근본적 불안감을 키우고 있습니다.
로컬 LLM 커뮤니티에서는 저사양 명령어 생성용 소형 모델부터 멀티 GPU 추론 최적화, 외장 GPU 확장 장치까지 실전 하드웨어·소프트웨어 운용 노하우가 활발히 공유되고 있습니다.
한 사용자는 llama.cpp 기반으로 CPU에서 구동 가능한 4B 이하의 소형 LLM을 찾고 있으며, 자연어 명령을 셸커맨드로만 출력하고 강제 추론 과정이 없는 모델을 요구하고 있습니다. 한편 R9700 GPU 4장을 사용한 사용자는 공식적으로 듀얼 구성만 지원되는 vLLM-Radiance를 쿼드 구성으로 구동해 프리필 17,636 토큰, 최대 생성속도 106 tok/s(MTP4 수락률 80%)를 달성했다고 공유했습니다. 이는 EPYC 7282와 Qwen 3.8 27B FP8 262K 컨텍스트 모델 조합으로, 4장 모두 nvtop 기준 100% 사용률을 기록했다고 밝혔습니다. 또 다른 사용자는 A40 GPU를 NVLink로 묶어 외장 인클로저에 연결하려는 구성을 고민 중이며, 서버 섀시 내부 공간 부족 문제를 오큘링크 확장 보드로 해결하려는 방안을 논의했습니다. 이 외에도 DGX Spark 한 대에서 Ling-3.0-flash 모델로 HTML 스네이크 게임을 생성한 사례(2,429 토큰, 70.57초, 34.42 tok/s)와 Android Studio가 llama.cpp 기반으로 Gemma 4 모델(34GB VRAM, 최대 128K 컨텍스트)을 네이티브 지원한다는 소식도 함께 공유됐습니다.
이러한 논의들은 로컬 LLM 운용이 단순 모델 다운로드를 넘어 하드웨어 조합, 추론 엔진 선택, 컨텍스트 관리까지 세밀한 최적화가 필요한 영역으로 성숙하고 있음을 보여줍니다. 특히 비공식 멀티 GPU 구성이나 외장 확장 장치처럼 커뮤니티 차원의 실험적 해법이 실제 성능 개선으로 이어지는 사례가 늘고 있어, 로컬 AI 인프라 구축의 접근성과 효율성이 점차 높아지고 있습니다.
본 콘텐츠는 공개된 자료를 참고하여 자체적으로 요약·재구성한 것이며, 원문 저작권은 각 언론사 및 원저작자에게 있습니다.
이전글이 없습니다
다시 오른 유가와 물가, 잇따르는 지원 제도
2026.09.02