모델의 '믿음 변화' 포착, 트리 구조 강화 학습에 적용
Fork Where the Model Changes Its Mind: Belief-Shift Branching for Tree-Structured Reinforcement Learning
arXiv모델이 예측한 '믿음'의 변화를 포착하여, 그 믿음이 가장 크게 갈라지는 지점(pivot)에 분기점을 설정하는 새로운 강화 학습 기법을 제안했습니다.
- 이 방법은 기존의 구조적 방식이나 엔트로피 기반 접근보다 우수하며, 특히 수학 및 코딩 같은 복잡한 추론 영역에서 높은 성능 향상을 입증했습니다.
- 이는 AI가 복잡한 사고 과정을 거칠 때, 결정적인 '사고 변화' 지점을 포착하여 모델의 학습 효율성을 근본적으로 개선할 수 있음을 보여줍니다.
- 별도의 단계별 지도 학습이 필요 없으며, 실제 구동 시 전체 연산량 대비 1~5% 내외의 낮은 계산 비용을 유지하는 것이 장점입니다.
트리 구조를 이용한 평가(RLVR)는 검증 가능한 보상을 제공하는 비평가 기반 기법입니다. 기존 연구에서는 분기점(fork)을 고정된 길이, 중간 지점 또는 다음 엔트로피 등 구조적 방식으로 배치했습니다. 본 논문은 이러한 분기점 배치를 체인의 가치 곡선에서 기대 결과가 전환되는 '피벗(pivots)' 위치를 찾는 것으로 공식화하고, 이를 바탕으로 '믿음 변화 분기(belief-shift branching)' 기법을 제안합니다.
이 방법은 후보 경계 지점에서 모델의 답변에 대한 믿음을 읽어내고, 연속적인 믿음이 가장 크게 발산되는 직전에 분기를 수행합니다. 이 접근 방식은 별도의 단계별 지도 학습이 필요하지 않으며, 실제 구동 시 수학 분야에서는 전체 연산량 대비 약 1%, 코딩 분야에서는 5% 미만의 낮은 계산 비용을 유지하는 것이 특징입니다.
실험 결과에 따르면, 믿음 변화 신호는 기존의 엔트로피 기반 방식이나 구조적 방식 등 모든 기준선보다 우수한 성능을 보였습니다. 특히 수학 및 코드 영역에서 높은 개선율을 입증했는데, OLMo-3-7B 모델에서는 종합적으로 +2.6점, AIME 2026에서 +2.9점의 향상을 기록했으며, LiveCodeBench-medium에서는 모든 코딩 항목에서 +6.5점의 성능 향상을 보였습니다.
용어 풀이
- 강화 학습
- 행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.