본문 바로가기

주메뉴 바로가기

전체메뉴

미디어룸

오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.

OpenAI가 넓힌 ChatGPT 광고, 사용자 신뢰가 시험대에 올랐다

AI 트렌드2026.09.01
2026.09.01  ·  ONE AI 편집장
Daily
AI Trend

넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다

01 / 07 · 중요도 높음
Qwen3.8-Flash-Next 및 관련 모델의 llama.cpp 추론 최적화 열풍
한줄 요약

Qwen3.8-Flash-Next 모델을 둘러싸고 llama.cpp 커뮤니티에서 다양한 추론 최적화 실험과 설정 논쟁이 활발히 벌어지고 있습니다.

무슨 일이?

Qwen3.8-Flash-Next는 51B 파라미터 규모의 PLE n-gram 임베딩 테이블을 가진 모델로, llama.cpp의 최신 빌드에서 --lazy-mode 기본값이 auto로 바뀌면서 이 테이블이 RAM에 로드되지 않고 디스크에서 mmap 방식으로 읽히게 되어 사용자들 사이에 혼란이 발생했습니다. 이로 인해 RAM이 충분한 사용자는 prefill 속도 50%, 생성 속도 15% 저하를 겪어 --lazy-mode off 설정이 권장되고 있습니다. RTX PRO 6000(96GB)을 이 용한 벤치마크에서는 VRAM 용량에 따라 CPU 전용 8.34tok/s에서 96GB 풀 오프로드 시 109.07tok/s까지 성능이 크게 갈렸고, PLE 테이블을 강제로 CUDA에 올리면 오히려 108.5tok/s에서 1.95tok/s로 급락하는 현상도 확인됐습니다. 이 외에도 kvarn KV 양자화 포크로 76% 빠른 토큰 생성을 달성한 사례, MTP(Multi-Token Prediction) 압축 롤백 기법으로 16GB VRAM에서 컨텍스트와 속도를 동시에 개선한 사례, RDNA4 전용 커스텀 커널로 prefill 속도를 30배 끌어올린 R9V 프로젝트 등 다양한 최적화 시도가 공유됐습니다.

왜 중요해?

대형 MoE 및 하이브리드 아키텍처 모델이 늘어나면서 단순 파라미터 수보다 메모리 배치와 오프로드 전략이 실제 추론 속도를 좌우하는 핵심 요소로 부각되고 있습니다. 커뮤니티 주도의 세밀한 최적화가 하드웨어 제약이 있는 로컬 사용자에게도 대형 모델 활용 가능성을 넓히고 있습니다.

출처
reddit ① ·  ·  ·  ·  ·  ·  ·  ·  ·  ·  ·  ·
02 / 07 · 중요도 보통
로컬 LLM 커뮤니티의 신규/경쟁 모델 비교 및 활용 사례 (GLM 5.3, Mistral, Nanbeige, DeepSeek 등)
한줄 요약

로컬 LLM 커뮤니티에서 GLM 5.3, Nanbeige 4.2, DeepSeek V4 Flash 등 신규 오픈소스 모델들의 실사용 성능과 하드웨어 요구사항을 비교하는 논의가 활발히 이루어지고 있습니다.

무슨 일이?

한 사용자는 RTX PRO 6000 WS GPU를 4대(Flash 모델)와 6대(풀 모델) 대여해 GLM 5.3과 GLM 5.3 Flash 를 Q4 양자화로 로컬 구동하고, BlenderMCP를 통해 260㎡ 규모의 펜트하우스 3D 모델링을 성공적으로 수행했습니다. Q4 양자화 기준으로 Flash 모델은 약 190~200GB, 풀 모델은 약 450~470GB 용량이 필요했으며, 치수와 재질(PBR) 값을 구체적으로 명시한 프롬프트를 사용해야 정확한 결과가 나왔습니다. Nanbeige 4.2 3B DSpark 모델은 4B급 소형 모델임에도 Qwen 3.5 9B보다 강력하다는 평가를 받았고, 초당 약 35토큰 속도로 기존 버전의 느린 속도 문제를 개선했습니다. 또 다른 사용자는 Qwen-3.8-27B로 클라우드 코딩 구독을 대체해 RTX 3090에서 프리필 1000~1500tps, 생성 45~60tps 성능을 얻었다고 밝혔습니다. M5 Ultra 512GB 사용자들은 GLM-5.3, Kimi-K3, DeepSeek-V4-Flash 등 대형 모델의 MLX 양자화 버전 다운로드 목록을 공유하며 최적 양자화 조합을 논의했습니다.

왜 중요해?

고성능 오픈소스 모델들이 로컬 환경에서도 클라우드 서비스를 대체할 수준의 실용성을 보여주고 있다는 점이 확인되고 있습니다. 특히 소형 모델의 효율 개선과 대형 모델의 양자화 최적화가 동시에 진행되면서, 하드웨어제약에 따른 선택지가 다양해지고 있습니다.

출처
reddit ① ·  ·  ·  ·  ·  ·  ·
03 / 07 · 중요도 보통
NVIDIA-삼성 램 공급계약 관련 가격 조작 논란
한줄 요약

삼성전자가 향후 AI 메모리 생산량의 70%를 마이크로소프트, 구글, 엔비디아 등과 2031년까지 장기 계약으로 확보한 가운데, 엔비디아가 현재 시장가의 5분의 1 수준으로 램을 공급받으면서도 그래픽카드 가격은 계속 올리고 있다는 논란이 제기됐습니다.

무슨 일이?

한 레딧 이용자가 공유한 기사에 따르면, 삼성전자는 미래 AI용 램 생산량의 70%를 마이크로소프트, 구글, 엔비디아 등 주요 기업과의 장기 계약으로 2031년까지 묶어두었습니다. 이 계약 덕분에 엔비디아는 시중에서 개당 2,100달러에 거래되는 램을 300~500달러 수준으로 공급받고 있다는 주장이 나왔습니다. 이는 현재 스팟 시장가의 약 5분의 1에 불과한 가격입니다. 문제는 엔비디아가 이런 저렴한 계약 단가를 확보하고 있으면서도, 그래픽카드 가격은 마치 시장가로 램을 구매하는 것처럼 계속 인상하고 있다는 지적입니다. 이 때문에 커뮤니티에서는 이를 사실상의 가격 조작이 아니냐는 의문이 제기됐습니다.

왜 중요해?

이 논란이 사실이라면 엔비디아가 원가 절감 효과를 소비자에게 전혀 반영하지 않고 있다는 의미가 됩니다. 또한 삼성의 대규모 램 물량 선점이 전반적인 메모리 가격 상승을 부추기고 있다는 점에서, 애플 M5 울트라 등 다른 제조사의 제품 가격과 공급에도 영향을 줄 수 있다는 우려가 함께 제기되고 있습니다.

출처
04 / 07 · 중요도 높음
슬라이딩 윈도우 어텐션이 선형 어텐션보다 장문 추론에서 우수하다는 연구 발표
한줄 요약

새 연구에 따르면 어텐션 싱크를 결합한 슬라이딩 윈도우 어텐션이 후처리 학습을 거친 선형 어텐션보다 장문추론 성능에서 2~10배 우수한 것으로 나타났습니다.

무슨 일이?

Alexia Jolicoeur-Martineau 등이 발표한 새 논문은 LLM의 이차 비용 문제를 해결하기 위한 방법으로, 어텐션 싱크를 적용한 슬라이딩 윈도우 어텐션(SWA)이 선형 어텐션 변형들보다 우수하다고 주장합니다. Needle- in-a-Haystack과 BABILong이라는 장문 추론 벤치마크에서 SWA는 선형 어텐션보다 2배에서 10배 높은 성능을 기록했습니다. 연구진은 그동안 선형 어텐션으로의 후처리 학습 파이프라인이 SWA 같은 더 단순한 기준선과 제대로 비교되지 않았다고 지적합니다. SWA는 별도의 후처리 학습 없이도 빠르게 동작하며 메모리 사용량도 낮게 유지되는 것으로 설명됩니다. 반면 선형 어텐션은 SWA 수준에 도달하려면 처음부터 학습하거나 대규모 후처리 학습이 필요하다고 언급됩니다.

왜 중요해?

이 결과는 메모리 제약이 있는 로컬 LLM 추론 환경에서 복잡한 선형 어텐션 대신 더 단순한 SWA 방식을 채택하는 것이 실용적일 수 있음을 시사합니다. 연구진은 "후처리 학습된 선형 모델 대신 SWA로 전환할 것을 강력히 권장한다"고 밝히며 업계의 연구 방향에 재검토를 요구하고 있습니다.

출처
05 / 07 · 중요도 높음
OpenAI ChatGPT 광고 도입 확대
한줄 요약

OpenAI가 오늘부터 ChatGPT 내 광고 노출 대상을 확대 적용하기 시작했습니다.

무슨 일이?

OpenAI가 ChatGPT에서 광고를 볼 수 있는 사용자 범위를 오늘부터 넓히기 시작했습니다. 기존에는 일부 제한된 사용자군에게만 테스트 형태로 광고가 노출되었으나, 이번 조치로 더 많은 사용자가 ChatGPT 사용 중 광고를 접하게 됩니다. 이는 무료 및 저가 요금제 사용자를 중심으로 수익 모델을 다각화하려는 움직임으로 해석됩니다. 구체적인 광고 형식이나 노출 위치에 대한 세부 내용은 게시글에 명시되어 있지 않지만, 챗봇 인터페이 스 내 광고 도입이라는 방향성 자체가 주목받고 있습니다.

왜 중요해?

챗봇 서비스에 광고가 결합되는 것은 AI 제품의 수익화 방식이 검색 엔진과 유사한 광고 기반 모델로 옮겨가고있음을 보여줍니다. 사용자 경험과 신뢰성에 어떤 영향을 미칠지, 그리고 경쟁사들도 유사한 전략을 따를지 여부가 향후 관심사로 떠오르고 있습니다.

출처
06 / 07 · 중요도 높음
AI의 사회적 영향: 일자리, 교육, 엔터테인먼트 산업 변화
한줄 요약

AI가 엔터테인먼트, 노동 시장, 대학 교육 전반을 동시에 뒤흔들며 사회 구조 자체의 변화를 예고하고 있습니다.

무슨 일이?

중국 엔터테인먼트 업계에서는 AI 생성 영상이 실제 배우와 라이브 스트리머의 자리를 서서히 대체하고 있습니다. 한편 메타는 데이터센터 내 기술자가 수행하던 작업에 로봇을 투입하는 실험을 진행 중입니다. 커뮤니티에 서는 2000년대 닷컴 시대와 2010년대 클라우드 시대, 2020년대 자동화 시대까지는 일자리가 사라진 것이 아니라 형태만 바뀌는 '전환'이었지만, 2023년 이후 생성형 AI와 에이전트형 AI는 화이트칼라 업무 자체를 통째로 없애는 양상이라는 우려가 제기됐습니다. 기업들이 대다수 직원을 줄여도 업무에 큰 지장이 없다는 사실을 빠르게 확인하고 있다는 지적입니다. 교육 분야에서도 MIT가 AI 위원회 보고서를 통해 AI가 이제 대부분의 학부 과제를 신뢰할 만한 수준으로 완수할 수 있다고 경고하며, 대학 교육 모델 전반의 개편을 검토 중입니다.

왜 중요해?

엔터테인먼트, 노동, 교육이라는 세 축에서 동시에 AI로 인한 구조적 변화가 감지되고 있다는 점이 중요합니다. 특히 과거의 기술 전환과 달리 이번에는 직업의 '형태 변화'가 아니라 '필요성 자체의 소멸'이 우려되는 만큼, 사회 전반의 대응 체계 마련이 시급해지고 있습니다.

출처
reddit ① ·  ·  ·
07 / 07 · 중요도 보통
AI 관련 사회·정치 이슈 (중국의 데이터센터 반대 선전, 튀르키예 경찰 드론, 영란은행 경고)
한줄 요약

데이터센터 반대 선전, 경찰 드론 단속, AI 금융위험 경고까지 AI가 정치·치안·경제 전반에서 새로운 갈등과 우려를 낳고 있습니다.

무슨 일이?

Axios 보도에 따르면 미국 내 데이터센터 건설을 반대하는 선전 활동에 중국이 연계되어 있다는 의혹이 제기되었습니다. AI 인프라 확장을 둘러싼 지역 갈등이 지정학적 정보전으로 확산될 가능성을 보여주는 사례로 주목받고 있습니다. 한편 튀르키예 경찰은 드론을 활용한 실시간 법 집행을 시작했으며, 공개된 영상에서는 드론이 "이 지역에서 음주는 금지되어 있습니다. 즉시 이 지역을 떠나십시오"라는 경고 음성을 송출하는 모습이 확인되었습니다. 이는 AI 기반 감시·단속 기술이 실제 치안 현장에 투입되는 초기 사례로 평가됩니다. 동시에 영란은행총재는 최신 AI 모델들이 금융시장의 급격한 변동성과 시스템적 위험을 키울 수 있다고 경고하며, 글로벌 금융안정성 차원의 규제 필요성을 제기했습니다.

왜 중요해?

세 사건은 AI 기술이 국가 간 여론전, 공공 치안, 금융 시스템이라는 서로 다른 영역에서 동시에 사회적 신뢰와 안전성 문제를 촉발하고 있음을 보여줍니다. 기술 발전 속도에 비해 규제와 사회적 합의가 뒤처지고 있다는 우려가 커지고 있습니다.

출처
Notice ONE AI 편집장  ·  2026-09-01

본 콘텐츠는 공개된 자료를 참고하여 자체적으로 요약·재구성한 것이며, 원문 저작권은 각 언론사 및 원저작자에게 있습니다.

ONE AI 세미나 신청
구매상담
1688
5000