모델 연구
PRO-Step: Step-level Process Reward Optimization for Retrieval-Augmented Generation
ARarXiv
기존의 검색 증강 생성(RAG) 모델은 최종 답변만 평가하여, 복잡한 다단계 추론 과정 중 발생하는 중간 단계의 오류를 효과적으로 잡아내지 못하는 한계가 있었습니다.
세 줄 요약
- 연구진은 각 추론 단계마다 논리적 타당성과 외부 근거 기반을 동시에 평가하는 'PRO-STEP'이라는 새로운 방법을 제시했습니다.
- 이 기술은 단순히 최종 결과만 맞추는 것을 넘어, 전체 추론 과정을 검증함으로써 LLM의 신뢰도와 정확도를 근본적으로 높이는 데 기여합니다.
- PRO-STEP은 다단계 QA 데이터셋에서 최고 수준의 성능을 입증하며, 향후 LLM 기반 시스템의 신뢰성 검증 기준을 한 단계 끌어올렸습니다.
기존의 검색 증강 생성(RAG) 모델은 최종 답변만 평가하여, 복잡한 다단계 추론 과정 중 발생하는 중간 단계의 오류를 효과적으로 잡아내지 못하는 한계가 있었습니다.