본문 바로가기

주메뉴 바로가기

전체메뉴

미디어룸

오늘을 넘어 미래의 가치를 만드는 더존ICT그룹의 소식을 만나보세요.

수학자들이 제기한 데이터 도용 의혹, 입력 자료 관리가 과제로 남았다

AI 트렌드2026.09.09
2026.09.09  ·  ONE AI 편집장
Daily
AI Trend

넘쳐나는 전 세계 AI 이슈, 핵심만 골라 ‘ONE AI’가 브리핑해 드립니다

01 / 07 · 중요도 높음
OpenAI, 나비에-스토크스 밀레니엄 문제 해결 주장과 진위 논란
한줄 요약

OpenAI가 밀레니엄 문제 중 하나인 나비에-스토크스 방정식을 풀었다고 발표했지만, 그 진위와 연구 윤리를 둘러싼 논란이 동시에 터졌습니다.

무슨 일이?

OpenAI는 약 1만 개의 동시 에이전트를 활용해 나비에-스토크스 방정식의 특정 시나리오, 즉 완전히 매끄러운 비압축성 초기 조건에서 유한한 에너지를 가진 경우에도 특이점이 발생할 수 있음을 보였다고 발표했습니다. 그 러나 항공우주공학 교수 크리스 콤스는 이것이 일반해를 구한 것이 아니라 매우 제한적인 수학적 가정 하의 결과이며, 실제 항공우주 분야의 방정식 활용 방식에는 거의 영향이 없다고 반박했습니다. 더 큰 논란은 별도로 이 문제를 연구해온 수학자 트리스탄 벅마스터와 레벤트 알포게가 자신들의 초안을 코덱스에 입력해왔는데, 발표직전 OpenAI가 동일한 해법을 들고 나타났다는 점입니다. OpenAI는 이들의 특정 사용자 데이터에 직접 접근하지 않았다고 밝혔지만, 비식별화된 데이터가 모델 개선에 기여했을 가능성은 배제하지 않았습니다. 전직 OpenAI RL 부문 부사장 제리 트워렉조차 모델이 접근하지 말아야 할 데이터에 접근했을 가능성이 0보다 크다고 언급했습니다.

왜 중요해?

AI가 실제로 독자적인 수학적 발견을 해낸 것인지, 아니면 인간 연구자들의 미공개 아이디어를 학습 데이터를 통해 흡수한 결과인지에 대한 근본적 의문이 제기되었습니다. 이는 향후 AI 기업과 연구자 간 데이터 사용 및 저 작권 관련 신뢰 문제로 확산될 가능성이 큽니다.

출처
reddit ① ·  ·  ·  ·  ·  ·  ·  ·  ·  ·  ·  ·  ·  ·  ·  ·  ·  ·
02 / 07 · 중요도 높음
OpenAI의 수학자 데이터 도용 의혹 (Buckmaster·Alpöge 사건)
한줄 요약

수학자 두 명이 1년간 Navier-Stokes 관련 난제를 풀며 Codex에 입력했던 초안들이, 출판 직전 OpenAI의 새모델 결과물과 유사하게 나타나면서 데이터 무단 사용 의혹이 제기됐습니다.

무슨 일이?

수학자 Tristan Buckmaster와 Levent Alpöge는 강제 3D 오일러 방정식의 유한 시간 폭발 문제를 연구하며 작업 초안들을 OpenAI의 Codex에 계속 입력했습니다. 출판을 앞둔 시점에 OpenAI가 자사 모델(Sol과 Astra 로 불림)로 동일한 문제의 해법을 공개하면서, 이들은 자신들의 비공개 작업물이 학습에 활용됐을 가능성을 제기했습니다. OpenAI는 연구진이나 에이전트가 이들의 특정 사용자 데이터에 직접 접근하지 않았다고 밝혔지만, 비식별화된 데이터가 모델 개선에 기여했을 가능성은 배제하지 못한다고 답했습니다. 전직 OpenAI RL 부문 VP였던 Jerry Tworek도 접근하지 말아야 할 데이터에 모델이 접근했을 가능성이 "0보다 크다"고 언급했습니다. 이와 관련해 AI 보안 연구자들의 데이터 포이즈닝 연구도 함께 언급되는데, 130억 파라미터 모델을 2600 억 토큰으로 학습시킨 실험에서 단 250개의 오염 문서(전체의 0.00016%)만으로도 특정 백도어 행동을 안정적으로 심을 수 있었다는 결과가 제시됐습니다.

왜 중요해?

극소량의 데이터로도 모델 행동에 영향을 줄 수 있다는 연구 결과는, 사용자가 입력한 소량의 미공개 아이디어조차 모델 학습에 실질적 영향을 미칠 수 있음을 시사합니다. 이는 AI 기업의 데이터 사용 투명성과 사용자 프라이버시 보호에 대한 근본적 신뢰 문제를 제기합니다.

출처
reddit ① ·  ·  ·  ·
03 / 07 · 중요도 보통
Astra 모델의 실세계 작업 능력 시연 (로봇 그림, SNES 디컴파일)
한줄 요약

Astra 모델이 로봇 팔을 조종해 실물 그림을 그리고 SNES 게임 롬을 읽을 수 있는 소스 코드로 디컴파일하는 등 실세계 작업 능력을 시연했습니다.

무슨 일이?

한 개발자가 Astra에게 로봇과 붓, 카메라를 제공하고 금문교를 실제로 그려보라고 요청했습니다. Astra는 스스로 로봇을 제어하는 방법을 학습했고, 시도를 반복할수록 그림 완성도가 점진적으로 개선되는 모습을 보였습니다. 이 과정을 담은 타임랩스 영상이 커뮤니티에서 큰 반응을 얻었습니다. 또한 다른 게시글에서는 Astra가 별도의 에뮬레이터 없이 SNES 롬 이미지를 분석해 사람이 읽을 수 있는 소스 코드를 가진 독립 실행형 게임으로 디컴파일할 수 있다는 사례도 공유됐습니다. 이는 Astra가 시각-행동 피드백 루프와 저수준 코드 분석 모두에서 실질적인 문제 해결 능력을 갖췄음을 보여줍니다.

왜 중요해?

로봇 제어와 리버스 엔지니어링처럼 서로 다른 영역에서 시행착오를 통한 자기 개선 능력을 보여준 점이 주목할 만합니다. 이는 AI가 물리적 세계와 디지털 코드 영역 모두에서 실용적 자율성을 갖춰가고 있다는 신호로 해석됩니다.

출처
04 / 07 · 중요도 보통
로컬 LLM 하드웨어 및 성능 최적화 논의 (GPU 선택, 멀티 GPU 벤치마크)
한줄 요약

로컬 LLM 커뮤니티에서 GPU 선택, 멀티 GPU 동시 실행 한계, 하드웨어 최적화 빌드에 대한 실전 데이터가 활발히 공유되고 있습니다.

무슨 일이?

r/LocalLLaMA에서 로컬 LLM 실행을 위한 하드웨어 최적화 논의가 이어지고 있습니다. 한 사용자는 2× RTX 4090으로 3주간 동시 에이전트 실행을 벤치마크해, 컨텍스트 64k 기준 소프트 캡 5개, 하드 캡 9개라는 결과를 공개했습니다. 122B MoE 모델은 도구 호출당 11.91초가 걸려 27B 모델의 3.40초보다 느려 포기했고, 35B MoE는 디코딩 속도 78tok/s로 가장 빨랐지만 코드 작업 5개 중 1개를 실패해 27B(5/5 성공)를 최종 선택했다고 밝혔습니다. 또 다른 사용자는 7900XTX 한 대 또는 두 대에 최적화한 커스텀 llama.cpp 빌드를 공개했는데, Qwen3.8 27B Q8_0 기준 PCIe x4로 연결된 카드에서도 프롬프트 처리 1600tk/s, 코드 생성 100tk/s 이상을 기록했습니다. 이 외에도 RTX 2060 2장에서 RX 6800 시리즈로의 업그레이드 문의, GPU별 용량당 가격과 대역폭을 정리한 가이드, PSU 용량 부족으로 인한 GPU 버스 이탈 문제 해결 사례 등이 공유됐습니다.

왜 중요해?

로컬 LLM 운영에서는 모델 크기보다 실제 처리량과 에이전트 동시성이 실용성을 좌우한다는 점이 데이터로 확인됐습니다. AMD GPU 최적화 빌드와 저전력 PSU 이슈 등 실전 노하우가 축적되면서 로컬 추론 환경의 접근성과 효율성이 높아지고 있습니다.

출처
reddit ① ·  ·  ·  ·
05 / 07 · 중요도 보통
다양한 신규 오픈소스 소형/중형 모델 출시 및 비교
한줄 요약

Qwen, DeepSeek, Ling, Nex 등 다양한 오픈소스 소형·중형 모델이 잇따라 출시되며 추론 엔진 성능 비교와 모델 선택 논쟁이 활발해지고 있습니다.

무슨 일이?

RTX PRO 6000 Blackwell 워크스테이션에서 Qwen3.8-Flash-Next 모델을 llama.cpp, SGLang, FreeToken 세 엔진으로 비교한 테스트 결과가 공유되었습니다. 262K 풀 컨텍스트에서 첫 토큰까지 걸린 시간은 SGLang 35.4초, FreeToken 80.4초, llama.cpp+MTP 210.2초, llama.cpp 기본 258.4초로 최대 7.3배차이가 났습니다.

반면 시작 시간은 llama.cpp가 16초로 가장 빨랐고 SGLang 108초, FreeToken 126초로 오히려 느렸습니다. 컨텍스트가 길어질수록 llama.cpp의 디코딩 속도는 101.9에서 20.2 tok/s로 급락했지만 FreeToken은 100.1에서 94.8 tok/s로 안정적이었습니다. 이와 함께 Qwen-Drive-1.0-4B, Nex-N2.5-mini, Ling-3.0-flash-VL, Spark-X2.5-4B 등 다양한 소형 모델이 잇따라 공개되었고, DeepSeek V4.1 Flash도 API 베타 테스트에 들어가며 신규 멀티모달 아키텍처를 예고했습니다.

왜 중요해?

동일 모델이라도 엔진, 양자화, KV 캐시 방식에 따라 성능이 수배까지 갈리는 만큼, 로컬 LLM 생태계에서는 모델 선택보다 엔진 최적화가 실사용 체감에 더 큰 영향을 미칠 수 있음을 보여줍니다. 동시에 소형 모델 춘추전국 시대가 열리면서 초소형 고성능 모델과 초효율 대형 모델 사이의 방향성 논쟁도 커지고 있습니다.

출처
reddit ① ·  ·  ·  ·  ·  ·
06 / 07 · 중요도 보통
AI 발전 속도에 대한 낙관론과 우려 (RSI, 안전성, 미래 전망)
한줄 요약

AI가 IMO 금메달 수준을 넘어 밀레니엄 문제에 도전하는 속도를 보이면서, 자기개선형 AI(RSI)의 안전성 검증이 경쟁 속도를 따라가지 못할 수 있다는 우려가 커지고 있습니다.

무슨 일이?

r/singularity에서는 AI 발전 속도에 대한 낙관과 경계가 동시에 제기되고 있습니다. 한 게시글은 AI가 1년도 안되는 기간에 IMO 금메달 수준에서 밀레니엄 문제 진전까지 도달했다며 2027년의 모습을 궁금해했습니다. OpenAI의 Noam Brown 등 연구자들의 트윗을 두고는 "다가오고 있다"는 발언이 구체적으로 무엇을 의미하는지에 대한 추측이 이어졌습니다. 가장 논쟁적인 글은 RSI(재귀적 자기개선) 모델의 안전성 병목 문제를 다뤘습니다. 작성자는 OpenAI가 RSI 모델을 확보해 경쟁사보다 4개월 앞서 있다고 가정하더라도, 안전성 검증에 모델 훈련보다 더 오랜 시간(예: 훈련 2주 대비 안전 검증 2개월)이 걸린다면 실질적인 격차는 크게 줄어들 것이 라고 분석했습니다.

왜 중요해?

경쟁 압박 속에서 안전성 검증을 충분히 거치지 않은 채 RSI를 밀어붙이는 회사가 등장하면, 전체 업계가 안전기준을 낮추는 방향으로 내몰릴 위험이 있습니다. 이는 AI 발전 속도 자체보다 그 속도를 안전하게 관리할 수 있는 구조적 장치의 부재가 더 큰 위험 요인이 될 수 있음을 시사합니다.

출처
reddit ① ·  ·  ·
07 / 07 · 중요도 보통
NeurIPS AI 탐지기 오작동으로 논문 178편 부당 거부 논란
한줄 요약

NeurIPS가 AI 탐지기 하나만 믿고 논문 178편을 심사 없이 탈락시켰는데, 같은 탐지기가 심사위원장들의 논문마저 AI 작성물로 잘못 판정한 사실이 드러났습니다.

무슨 일이?

NeurIPS Position Paper Track이 Pangram이라는 사설 AI 탐지기를 사용해 전체 제출 논문의 18.4%인 178편을 인간 검토나 이의제기 절차 없이 데스크 리젝했습니다. 원래 이 탐지기는 제출 논문의 42.7%를 AI 작성물로 의심했는데, 주최 측이 텍스트 분석 범위를 줄여 탈락률을 12.7%까지 낮췄다는 사실이 드러났습니다. 독립 연구자들이 트랙 체어 3명의 최근 논문을 같은 탐지기로 검사한 결과 24~69%라는 AI 확률이 나와, 이들도 자신들의 기준으로는 탈락 대상이었다는 점이 확인됐습니다.

또한 22편은 저자가 AI 사용을 하지 않았다고 명 시했음에도 탐지 점수 0.5 초과만을 근거로 거짓 진술로 간주돼 탈락 처리됐습니다. 스탠퍼드 연구에 따르면 비영어권 저자의 정형화된 영어 문체 탓에 인간이 작성한 TOEFL 에세이의 61.22%가 AI로 오탐지되는데, NeurIPS는 이런 인구통계학적 보정 데이터를 전혀 공개하지 않았습니다.

왜 중요해?

블랙박스 AI 탐지 도구 하나에 의존해 대규모 논문을 자동 탈락시키는 관행이 학술 심사의 공정성을 심각하게 위협한다는 점을 보여줍니다. 특히 비영어권 연구자들이 구조적으로 불리한 판정을 받을 위험이 크다는 점에서, AI 탐지 기술의 신뢰성과 학계 도입 기준에 대한 논의가 시급해졌습니다.

출처
Notice ONE AI 편집장  ·  2026-09-09

본 콘텐츠는 공개된 자료를 참고하여 자체적으로 요약·재구성한 것이며, 원문 저작권은 각 언론사 및 원저작자에게 있습니다.

ONE AI 세미나 신청
구매상담
1688
5000