Nemotron 기반 AI, 올림피아드 수학 증명에 도전하다 — AI 생성 일러스트
리서치 연구

Nemotron 기반 AI, 올림피아드 수학 증명에 도전하다

An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics

arXiv9월 12일 발표 · 2분 · 프리프린트

연구진은 Nemotron 3 Ultra 모델을 기반으로 고난도 올림피아드 수학 증명을 오직 자연어만으로 생성하는 특화 AI 시스템을 구축했습니다.

세 줄 요약arXiv 원문 기반
  1. 이 시스템은 외부 도구나 공식 증명기 없이 반복적인 검색과 정교화를 거쳐, IMO 2026에서 금메달 기준점인 30/42점을 달성한 성과를 보였습니다.
  2. 이는 AI가 복잡하고 다단계적인 추론 과정을 자연어만으로 수행할 수 있음을 입증하며 학계에 큰 자극을 줄 것으로 기대됩니다.
  3. 연구진은 두 개의 특화 체크포인트와 새로운 벤치마크(Nemotron-IMO-Bench)를 공개하여 AI 수학 증명 연구의 발전에 기여합니다.

연구진은 Nemotron 3 Ultra 모델을 기반으로 고난도 올림피아드 수학 증명을 오직 자연어만으로 생성하는 특화 AI 시스템을 구축했습니다. 이 과정에서 지도 (supervised fine-tuning)과 (reinforcement learning)을 사용하여 두 개의 전문 체크포인트를 훈련하고, 이를 통해 체크포인트 선택 및 정제 과정을 평가했습니다.

이 시스템은 외부 증명기나 외부 도구, 인터넷 접속 없이 오직 자연어 환경에서 작동하는 테스트 시간 컴퓨팅 파이프라인으로 운영됩니다. 세 개의 Nemotron 3 Ultra 체크포인트가 반복적인 검색(생성, 검증, 정제)을 수행하며, 별도의 고성능 계산 단계가 최종 제출물을 선택했습니다. 이 시스템은 IMO 2026에서 총 42점 만점에 30점을 기록하여 금메달 기준에 도달하는 성과를 보였습니다.

연구진은 이 결과를 공개하며 두 개의 전문 체크포인트와 함께 학습 데이터, 훈련 및 추론 코드, 제출된 해답을 배포합니다. 또한 새로운 올림피아드 수준의 문제로 구성된 Nemotron-IMO-Bench라는 를 제공하여 AI 수학 증명 연구 발전에 기여할 계획입니다.

용어 풀이

미세 조정
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
강화 학습
행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · An Open Recipe for IMO Gold: Training Nemotron for Olympiad Mathematics
원문 보기arXiv