코드 기반 추론 데이터 합성으로 LLM의 논리 능력 향상
The Imitation Game: When LLMs Learn to Reason Like Programs via Code-Centric Reasoning Data Synthesis
arXivLLM이 자연어 추론 시 발생하는 오류를 개선하기 위해, 연구진은 실행 가능한 코드를 활용해 학습 데이터를 합성하는 MIMIC 프레임워크를 제안했습니다.
- MIMIC은 알고리즘을 검증 가능한 추론 궤적으로 변환하고, 외부 보상 모델 없이도 고정밀의 과정 감독 데이터(CIR)를 생성하는 것이 핵심입니다.
- 이 방법은 코드의 절차적 엄밀함을 활용하여, LLM이 일반 논리 추론이나 복잡한 수학 문제 등에서 높은 성능 향상을 보이도록 합니다.
- 실행 가능한 코드를 통해 데이터 신뢰도를 높이는 것이 LLM 추론 능력 강화의 핵심이며, 이는 다양한 복잡한 작업에 적용 가능합니다.
(LLMs)은 프로그래밍 작업에는 능하지만, 자연어에서 결정적이고 세밀한 추론을 수행하는 데 어려움을 겪으며, 견고한 기호 실행보다는 의미론적 근사에 크게 의존합니다. 연구진은 이러한 간극을 메우기 위해 MIMIC이라는 프레임워크를 제안했습니다. 이 프레임워크는 실행 가능한 코드를 엄격한 추론 데이터 합성 매체로 활용하며, 알고리즘을 서사 융합(narrative fusion), 코드 기반 테스트 합성, 동적 코드 계측 등을 통해 검증 가능한 추론 궤적으로 변환합니다.
MIMIC의 핵심은 외부 보상 모델 없이도 고밀도의 과정 감독 데이터를 제공하는 '코드-계측 보상(Code-Instrumented Reward, CIR)'을 생성한다는 점입니다. 이 과정을 통해 에 필요한 높은 충실도의 과정 감독이 가능해집니다. 연구진은 합성된 데이터셋을 사용하여 SFT 및 GRPO 방식으로 모델을 훈련시켰으며, 그 결과 상당하고 일관적인 성능 향상을 확인했습니다.
본 방법론은 실행 가능한 코드의 절차적 엄밀함을 활용하여 LLM의 일반화된 추론 능력을 효과적으로 끌어올릴 수 있음을 입증합니다. 광범위한 평가에 따르면, 이 방식은 일반 논리 추론, 복잡한 수학 , 그리고 세밀한 결정론적 작업 전반에서 정확도를 크게 향상시키는 것으로 나타났습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.