모델 연구
TTPO: Test-Time Policy Optimization
ARarXiv
LLM은 기존에 정답 레이블(Ground-truth)에 의존하는 학습 방식 때문에 테스트 단계에서 성능 개선이 어려웠습니다.
세 줄 요약
- TTPO는 이러한 한계를 극복하기 위해, 추론 과정의 유사 레이블을 활용하여 일치하는 경로는 강화하고 불일치 경로는 페널티를 주는 비대칭적 최적화 기법입니다.
- 이 방법은 '레이블과 다른 추론 경로는 틀릴 확률이 높다'는 가정을 기반으로 하므로, 정답 레이블 없이도 높은 안정성과 범용성을 확보합니다.
- 실제 벤치마크에서 지도 학습 방식과 유사한 성능을 달성했으며, 모델의 추론 능력을 크게 향상시키는 효과를 입증했습니다.
LLM은 기존에 정답 레이블(Ground-truth)에 의존하는 학습 방식 때문에 테스트 단계에서 성능 개선이 어려웠습니다.