리서치 연구
재귀적 언어 모델의 도메인 외 일반화 능력 연구
Recursive Language Models Generalize Out of Domain
arXiv연구진은 일반적인 추론 방식(CoT)과 각 하위 과제를 독립적으로 해결하는 재귀적 언어 모델을 비교하며, 특히 학습 범위를 벗어난 상황에서의 성능 차이를 분석했습니다.
세 줄 요약
- CoT는 전체 문맥에 의존하여 훈련 데이터의 '지름길'을 찾기 쉬워 오도메인(OOD)에서 실패할 위험이 있지만, 재귀 모델은 독립적인 컨텍스트 처리를 통해 이를 방지합니다.
- 학습 데이터 내에서는 큰 차이가 없으나, OOD 환경에서 CoT가 문맥에 의존하는 '단축키'를 사용해 오류를 일으키는 현상이 핵심적인 차이점입니다.
- 결론적으로 모델의 진정한 추론 능력을 위해서는 단순히 올바른 규칙을 아는 것을 넘어, 단순성 편향 같은 함정을 피할 수 있는 깊은 이해가 필수적입니다.
연구진은 일반적인 추론 방식(CoT)과 각 하위 과제를 독립적으로 해결하는 재귀적 언어 모델을 비교하며, 특히 학습 범위를 벗어난 상황에서의 성능 차이를 분석했습니다.