사실 검증 점수 향상에 대한 답변과 근거 자료의 기여도 분석
What Changes When Fact-Verification Scores Improve? Evidence and Answer Accounting Across Trained Verifiers and LLMs
arXiv사실 검증 점수 향상 시, 그 기여도가 답변의 정확도 때문인지 근거 자료(Evidence) 덕분인지를 분리 분석하여 파악했습니다.
- 연구 결과, 단순히 답변만 개선하는 것보다 근거 자료 자체를 보강했을 때 점수 상승 폭이 훨씬 커서 증거 제시의 질적 중요성을 입증했습니다.
- 따라서 모델 성능을 평가할 때는 종합 지표에 의존하기보다, 답변과 근거 자료 기여도를 분리하여 분석해야 더 정확합니다.
- 성능 향상 정도는 사용된 근거 자료 종류, LLM 모델, 그리고 입력 컨텍스트 길이 등 다양한 조건에 따라 달라질 수 있습니다.
공동 사실 검증 점수는 답변(answers)과 제출된 증거(evidence)를 함께 평가한다. 연구 결과, 엄격한 점수가 개선될 때 그 상승분 중 상당 부분이 단순히 답변 정확도의 향상보다는 근거 자료 자체의 보강에서 비롯됨을 확인했다. 구체적으로, DCUF 증거를 UnifEE 증거로 대체했을 경우 엄격한 점수는 9.61% 포인트가 증가했지만, 답변 정확도는 1.96% 포인트만 상승하는 것으로 나타났다.
답변을 고정하고 근거 자료만 변경하여 평가했을 때의 기여도 분석 결과도 제시되었다. DCUF 증거를 사용한 경우 7.92% 포인트, UnifEE 증거를 사용한 경우 9.08% 포인트의 점수 상승이 확인되었다. 이는 모델 성능을 평가할 때 종합적인 지표에 의존하기보다 답변과 근거 자료가 각각 얼마나 기여했는지 분리하여 분석해야 함을 시사한다.
을 이용해 응답을 생성하는 실험에서는 입력 컨텍스트 길이의 변화가 점수 향상에 영향을 미치는 것으로 나타났다. FEVEROUS 데이터셋에서 컨텍스트를 256 에서 2,048 토큰으로 늘리자 Qwen 모델은 고정 답변 근거 자료 점수가 3.84% 포인트 상승했고, Llama 모델은 3.10% 포인트의 상승을 보였다.
연구진은 사후 분석(Post-hoc analyses)을 통해 답변과 제출된 증거의 변화를 정량화했으며, 집계된 정확도나 증거 커버리지 비율 같은 종합적인 지표가 주장 수준에서 나타나는 패턴을 놓칠 수 있음을 밝혔다. 따라서 네 가지 조합으로 이루어진 점수 평가 방식이 중요한 변화를 포착할 수 있다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.