오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.
미·중 정상과 빅테크의 가속 발언, 규제 방향 확인이 필요하다
넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다
속도 조절에 반대하는 발언이 미국 정치권과 빅테크, 중국 쪽에서 같은 시점에 나왔고, 업계 안에서는 결이 다른 목소리도 확인됐습니다.
트럼프 대통령은 AI 개발을 점검할 필요성을 낮게 평가하며 중국에 우위를 넘겨주고 싶지 않다는 뜻을 밝혔고, 부정적인 세력들이 일어나지 않을 일들을 끌어들이고 있다며 AI에서 승리하는 쪽이 모든 것을 가져간다고 발언했습니다①.
마크 저커버그도 AI 개발을 가속화하겠다는 입장을 공개적으로 밝혔습니다②.
하원의장 마이크 존슨은 AI 업계 리더들의 규제 요구에 대해 의회의 긴급 모라토리엄 도입에 반대한다고 밝혔습니다. 플랫폼 리더들이 직접 모여 적절한 균형을 찾아야 하며, 모라토리엄을 시행하면 중국이 미국을 앞지를 것이라고 말했습니다③.
같은 시기 시진핑 주석은 중국이 브릭스 국가들 간의 AI 및 기술 협력을 주도하겠다고 발표했습니다④. 반면 팔란티어의 알렉스 카프 CEO는 AI 개발의 속도 조절, 즉 페이싱의 중요성을 강조했습니다⑤.
이번 자료에서는 정치권 최상층부와 빅테크 경영진, 중국 정상이 같은 시점에 가속 쪽 입장을 밝힌 사례가 확인됩니다. 각 발언에서 공통으로 제시된 근거는 안전성 평가가 아니라 중국 또는 상대 진영과의 경쟁 구도였습니다. 같은 흐름 안에서 속도 조절을 언급한 기업 경영진의 발언도 함께 확인됩니다.
AI 도입을 검토하는 입장에서는 규제 도입 시점을 예측하기보다, 현재 논의가 어떤 근거로 진행되는지를 확인하는 편이 현실적입니다. 경쟁 구도를 근거로 한 발언과 속도 조절을 언급한 발언이 함께 나오는 상황이므로, 특정 방향으로 정리됐다고 보기 어렵다는 점을 전제로 볼 수 있습니다.
주요 개발사들이 금융업 자율규제기구를 참고한 표준기구 설립을 논의 중이라는 보도가 나오면서, 그 형태를 둘러싼 상반된 우려가 함께 제기됐습니다.
The Information 보도에 따르면 Anthropic, Google, OpenAI가 금융업의 FINRA와 유사한 AI 산업 표준기구 설립을 위해 정기적으로 논의를 이어가고 있으며, 최근 주에도 회동이 있었습니다①.
커뮤니티에서는 정부 개입이 원자력 산업처럼 과잉규제로 기술 발전을 저해할 수 있다는 우려가 제기됐습니다②.
반대 방향의 비판도 나왔습니다. 2017년 자율주행차 관련 SELF DRIVE 법안 사례가 인용되며, 업계가 먼저 높은 수치를 제시하고 의회가 이를 낮추는 방식으로 타협처럼 보이게 하되 실제로는 성능 기준이 아닌 절차 기준만 남기는 패턴이 재현될 수 있다는 경고가 공유됐습니다③.
보도로 확인되는 것은 표준기구 설립 논의가 진행 중이라는 사실까지이며, 기구의 형태나 기준은 아직 제시되지 않았습니다. 같은 사안을 두고 과잉규제 우려와 규제 포획 우려가 함께 제기됐다는 점에서, 논의의 결과보다 어떤 기준이 담기는지가 쟁점으로 볼 수 있습니다.
향후 공개되는 기준을 볼 때는 성능이나 안전성에 대한 검증 요건인지, 절차와 기록에 대한 요건인지를 구분해 확인할 수 있습니다. 공급자를 검토할 때도 이런 표준 참여 여부와 실제로 공개하는 검증 내용을 별개 항목으로 볼 수 있습니다.
같은 모델 계열을 두고 양자화, 캐시 배치, 추측 디코딩을 조합해 측정한 값들이 환경별로 잇따라 공유됐습니다.
RTX 3090 환경에서는 vLLM AOT 컴파일과 INT4 AutoRound, FP8 KV 캐시를 조합해 평균 prefill 871tok/s, decode 38tok/s에 144K 컨텍스트까지 확보한 사례가 공유됐습니다①.
16GB급 저VRAM 환경에서는 KV 캐시를 호스트 RAM으로 스트리밍하면서 필요 시 MTP 추측 디코딩 모델을 즉석에서 로드·언로드하는 핫스왑 기법이 공유됐고, Strix Halo 포크 llama.cpp는 decode 52tok/s, prefill 1300tok/s를 기록했습니다②.
MacBook M5 Pro 대비 5배 빠른 100t/s를 기록했다는 후기도 공유됐습니다③.
저예산 구성으로는 4×AMD V620과 EPYC 7452로 128GB VRAM·256GB RAM 서버를 3000달러에 구축한 사례④와, 2×P40으로 45tg/s를 기록한 사례⑤가 공유됐습니다.
공유된 수치들은 각각 다른 하드웨어와 설정 조합에서 나온 개별 측정값입니다. 조합마다 GPU 등급, 양자화 방식, 캐시 배치, 추측 디코딩 적용 여부가 달라 서로 직접 비교하기 어려운 값들이며, 하나의 평균이나 일반적인 성능 수준으로 묶을 수 있는 지표는 아닙니다. 실행 설정에 따라 결과가 달라질 수 있다는 사례로 볼 수 있습니다.
로컬 실행을 검토한다면 GPU 용량만으로 판단하기보다 사용할 추론 엔진, 양자화 방식, KV 캐시 배치, 필요한 컨텍스트 길이를 함께 정한 뒤 그 조합에서 측정할 필요가 있습니다. 공유된 값은 개별 사용자 환경의 결과이므로, 자사 조건에서 재검증할 기준선으로 삼는 편이 적절합니다.
학습부터 서빙까지의 파이프라인을 오픈소스로 공개한 사례와, 마이크로컨트롤러에서 동작하는 초소형 모델 실험이 함께 공유됐습니다.
Tahuna Labs가 AI 학습 인프라 Tahuna를 오픈소스로 공개했습니다. init→sync→train→artifacts→serve 워크플로우로 소규모 팀도 모델 학습, 추론, GPU 오케스트레이션을 수행할 수 있도록 설계됐으며, 콘텐츠 주소 기반 코드·데이터 동기화와 재현 가능한 매니페스트 고정 실행을 지원합니다. 첫 공개 프리뷰는 RunPod과 R2를 지원하며 SFT, RL 에이전틱 서치, MNIST 예제를 포함합니다①.
825k 파라미터 모델로 RP2040 마이크로컨트롤러에서 실행되는 드로잉 프로그램을 생성한 연구에서는 생성 트레이스 12,670개 전부가 파이썬 레퍼런스와 일치했고, 인터프리터는 플래시 1,862바이트와 정적 RAM 0바이트를 사용했습니다②.
커뮤니티에서는 엔그램 기법을 활용한 9B 밀집 모델과 DeepSeek-V4.1-Flash 스타일의 KV 캐시 최적화에 대한 기대가 논의됐습니다③.
두 사례는 규모가 크게 다르지만, 제한된 자원에서 학습과 실행을 완결하는 방법을 다룬다는 점에서 같은 흐름에서 볼 수 있습니다. 학습 인프라 쪽은 재현 가능한 실행을 설계 항목으로 명시했고, 초소형 모델 실험에서는 생성 결과 전부가 레퍼런스와 일치했다는 검증 결과가 함께 제시됐습니다.
소규모 팀이 자체 모델을 다루는 구성을 검토한다면 학습 성능뿐 아니라 실행 재현성과 산출물 관리 방식을 확인 항목에 포함할 수 있습니다. 초소형 모델 사례는 특정 과제와 하드웨어 조건에서 나온 결과이므로, 적용 가능성은 자사 과제 범위에 맞춰 따로 확인할 부분입니다.
투자자 대상 흑자 전망이 전해진 한편, 개발사 내부에서 중대한 사건이 있었다는 출처 불명의 소문도 함께 확산됐습니다.
Anthropic이 투자자들에게 이번 분기에도 흑자를 기록할 것이라고 전했으며, 이는 2개 분기 연속 수익성을 달성하는 결과입니다①.
같은 시기 트위터에서는 주요 AI 랩 내부에서 중대한 사건이 발생했다는 소문이 퍼졌으나, 구체적인 근거나 출처는 명확하지 않은 상태입니다②.
일부 커뮤니티에서는 이런 소문이 단순한 과장이 아닐 수 있다는 주장이 제기됐고, 그 근거로 OpenAI의 모델이 훈련이 완료되지 않은 상태에서도 밀레니엄 문제 중 하나를 풀어낸 사례가 언급됐습니다③.
확인된 사실은 투자자 대상 흑자 전망이 전해졌다는 내용이고, 개발사 내부 사건에 대한 부분은 출처가 명확하지 않은 소문 단계입니다. 두 내용이 같은 시점에 확산됐으나, 서로를 설명하는 근거로 제시된 자료는 없습니다.
공급사 관련 정보를 다룰 때는 실적처럼 출처가 분명한 내용과 소셜미디어에서 확산되는 소문을 구분해 볼 필요가 있습니다. 소문 단계의 내용은 도입 판단의 근거로 삼기 어렵고, 공식 발표나 보도로 확인되는지를 기준으로 둘 수 있습니다.
본 콘텐츠는 공개된 사실 및 정보를 바탕으로, 당사의 편집 기준에 따라 생성형 인공지능(AI)에 의해 생성되었습니다. 최종 내용은 원문 대조 및 검수를 거쳐 발행하며, 참고한 각 자료의 저작권은 해당 저작권자에게 있습니다.