"AI가 수학 난제 수백개 풀어"…오픈AI 발표에 학계는 '글쎄'

기사등록 2026/10/09 00:55:00

오픈AI 수학 논문 722건 공개

린 검증 마친 결과는 22% 그쳐

프롬프트 비공개·검증 한계 논란

[그래픽=뉴시스] 재판매 및 DB금지. hokma@newsis.com

[서울=뉴시스]이지영 기자 = 오픈AI가 비공개 인공지능(AI) 모델로 미해결 수학 문제 수백 건에서 새로운 결과를 냈다고 발표했다. 다만 상당수는 아직 검증되지 않아 실제 성과를 판단하기에는 이르다는 학계 지적이 나온다.

8일(현지 시간) 가상자산 전문매체 디크립트에 따르면 오픈AI는 최근 내부 AI 모델이 작성한 수학 논문 722건을 깃허브에 공개했다.

오픈AI 측은 대부분의 결과가 단일 AI 에이전트에 한 번의 프롬프트를 입력해 나온 것이라고 설명했다. 일부는 여러 차례 시도가 필요했던 것으로 전해졌다.

다만 722건이 곧 722개의 수학 문제를 해결했다는 의미는 아니다.

공개된 논문은 서로 연관된 결과를 묶은 372개 그룹으로 구성됐다. 하나의 문제에서 핵심 정리와 추가 증명, 파생 결과 등이 여러 논문으로 나뉘어 포함될 수 있다.

오픈AI는 약 4000개의 문제를 모델에 제시했고 이 가운데 의미 있다고 판단한 결과만 공개했다고 밝혔다.

검증 수준도 아직 제한적이다.

722건 가운데 핵심 결과가 수학 검증 프로그램 '린(Lean)'으로 확인된 것은 162건으로 약 22%에 그쳤다. 린은 증명의 각 논리 단계를 기계적으로 확인하는 프로그램이다.

오픈AI 역시 모든 결과가 검증된 것은 아니라며 "형식화되지 않은 일부 결과에는 문제가 있을 수 있다"고 인정했다.

학계는 재현 가능성이 부족하다고 지적했다.

앤드루 서덜랜드 매사추세츠공대(MIT) 교수는 "모델이 공개되고 다른 연구자들이 결과를 재현하기 전까지 단일 에이전트가 한 번에 문제를 풀었다는 주장은 검증되지 않은 것으로 봐야 한다"고 평가했다.

특히 오픈AI가 실제 사용한 프롬프트를 공개하지 않은 점도 논란이다.

프린스턴 고등연구소(IAS) 자문그룹은 지난달 AI 수학 연구 결과를 공개할 경우 모델명과 프롬프트, 추론 요약, 소요 시간, 연산 비용 등을 함께 제시해야 한다고 권고했다.

하지만 오픈AI는 평균 연산량과 일부 추론 요약만 공개했고 실제 프롬프트는 공개하지 않았다.

오픈AI에 따르면 이번 결과 하나를 얻는 데 평균적으로 챗GPT 프로 기준 약 3시간의 추론 연산량이 사용됐다.

지난달 유체역학의 대표적 난제로 꼽히는 나비에-스토크스 방정식 연구에서 1만개의 AI 에이전트를 88시간 동안 동시에 활용했던 것과 비교하면 훨씬 적은 연산량이다.

다만 이번 결과 대부분이 수학계를 뒤흔들 만한 난제를 해결한 것은 아니라는 평가도 나온다.

아비셰크 사하 교수는 "수학계에 매우 중요한 날"이라고 언급하면서도 "대부분의 성과는 기존 연구 흐름 안에서 나온 발전이나 예상 밖의 진전에 가깝다"고 설명했다.

공개된 722건 가운데 밀레니엄 문제에 준하는 수준으로 평가될 만한 문제는 '준 리만 가설(Quasi-Riemann Hypothesis)' 한 건에 불과한 것으로 전해졌다.

수학계에서는 AI가 사람도 이해하기 어려운 수학적 증명을 대량으로 생산할 수 있는 시대에 들어서면서 새로운 검증 방식이 필요하다는 목소리도 나온다.

프린스턴 고등연구소는 "AI가 인간이 이해하거나 검증하기 어려운 수학적 논증을 만들어낼 수 있는 상황이 됐다"며 "수학에서 인간의 이해가 여전히 핵심이라는 점을 어떻게 지킬 것인지 고민해야 한다"고 밝혔다.

오픈AI는 향후 린을 통한 추가 검증 결과를 공개하고, 내부 모델 공개 여부도 검토할 방침이다.


◎공감언론 뉴시스 jee0@newsis.com