언어 모델의 조합적 추론 능력과 강화 학습 연구
Compositional Reasoning in Language Models under Reinforcement Learning Post-Training
arXiv언어 모델의 실제 문제 해결 능력을 측정하기 위해 의존성 그래프 기반의 조합적 추론 프레임워크를 제안했습니다. 이는 학습된 기술을 새롭게 결합하는 '조합적 추론' 과정을 체계적으로 분석한 연구입니다.
- 실험 결과, 개별 기술만으로는 복잡한 과제 해결이 어렵다는 점과 달리, 복합 과제를 학습하면 그 구성 요소로 지식이 역전이되는 비대칭성이 발견되었습니다.
- 이는 언어 모델의 추론 능력이 단순한 지식 축적을 넘어 여러 기술을 구조적으로 조합하는 이해에 달려 있음을 보여주며 AI 발전에 중요한 이론적 기반을 제시합니다.
- 연구진은 이 비대칭성에 대한 이론적 설명을 제공하고, 길이 외삽이나 구조 변화 등 다양한 조건에서 일반화 능력을 평가했으며 실제 도구 호출 환경에서도 유사한 현상을 확인했습니다.
실제 문제 해결을 위해서는 언어 모델이 학습된 기술들을 새로운 방식으로 결합하는 '조합적 추론(Compositional reasoning)' 능력이 필수적입니다. 본 연구는 이러한 과정을 체계화하기 위해 의존성 그래프 프레임워크를 제안하며, 이를 통해 조합성을 점진적으로 복잡해지는 세 가지 수준으로 공식화했습니다. 이 프레임워크는 데이터 구조 과제를 사용하여 경험적으로 구현되었으며, 명확한 조합적 구조와 결정론적인 보상 계산을 제공합니다.
실험 결과, 연구진은 '분해된 기술(decomposed-skill)'로 학습하는 것이 복잡하게 구성된 과제에는 안정적으로 전이되지 않는 비대칭성을 발견했습니다. 반면, 조합된 과제를 통해 학습한 지식은 그 구성 요소인 분해된 과제로 더 쉽게 역전이되는 현상이 관찰되었습니다. 연구진은 이 비대칭성에 대한 이론적 설명을 제공하며, 언어 모델의 추론 능력이 단순 축적을 넘어 구조적인 결합 이해에 달려 있음을 시사했습니다.
나아가 본 연구는 조합적 일반화 능력을 길이 외삽이나 구조 분포 변화 등 다양한 조건에서 평가했으며, 실제 환경에서의 적용 가능성도 탐구했습니다. 특히 실세계 도구 호출 를 통해 이러한 분해-조합 비대칭성이 이론적인 영역을 넘어 실제 활용 가능한 설정에서도 확장될 수 있다는 예비 증거를 제시하였습니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.