개발도구 연구

From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers

ARarXiv8월 26일 발표 · 1분 · 심사 전 논문

이 논문은 오픈 도메인 질문 답변의 효과적인 보상 신호를 위해 루브릭 기반 정렬 프레임워크를 제안한다.

세 줄 요약arXiv 원문 기반
  1. 제안된 프레임워크는 검색된 증거에 근거한 쿼리별 루브릭을 생성하고, 이를 여러 품질 차원으로 분해하여 미세 지도 학습을 제공한다.
  2. 루브릭을 검색된 증거에 조건화하면 사실적 지원이 향상되며, 품질 차원 분해를 통해 일관성 및 요구사항 준수를 높인다.
  3. 평가 결과는 구성(composition), 근거 마련(grounding), 지침 준수(instruction-following) 세 가지 평가 축을 기준으로 성능 개선을 측정했다.

이 논문은 오픈 도메인 질문 답변의 효과적인 보상 신호를 위해 루브릭 기반 정렬 프레임워크를 제안한다.

원문arXiv · From Preferences to Principles: Rubric-Based Alignment for Grounded Knowledge Answers같은 주제 가이드 · 바로 써 보기오류가 나면 터미널 출력째 묻기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기