개발도구 연구
From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers
ARarXiv
이 논문은 오픈 도메인 질문 답변의 효과적인 보상 신호를 위해 루브릭 기반 정렬 프레임워크를 제안한다.
세 줄 요약
- 제안된 프레임워크는 검색된 증거에 근거한 쿼리별 루브릭을 생성하고, 이를 여러 품질 차원으로 분해하여 미세 지도 학습을 제공한다.
- 루브릭을 검색된 증거에 조건화하면 사실적 지원이 향상되며, 품질 차원 분해를 통해 일관성 및 요구사항 준수를 높인다.
- 평가 결과는 구성(composition), 근거 마련(grounding), 지침 준수(instruction-following) 세 가지 평가 축을 기준으로 성능 개선을 측정했다.
이 논문은 오픈 도메인 질문 답변의 효과적인 보상 신호를 위해 루브릭 기반 정렬 프레임워크를 제안한다.