LLM이 제시하는 거절 근거의 실제 영향력 검증 연구
Does a model's stated reason for rejecting a candidate do any work?
arXivAI가 후보를 거절할 때 제시하는 '근거'가 실제로 최종 결정에 영향을 주는지 과학적으로 검증한 연구입니다.
- 특히, 모델이 지목한 후보의 프로필에 실제 정보를 삽입했을 때, 단순히 무관한 내용을 넣었을 때보다 선택 변화가 더 크게 나타났습니다.
- 이는 언어 모델이 단순히 유창한 설명을 만드는 것을 넘어, 주어진 정보의 '내용' 자체를 기반으로 깊이 있게 추론하고 선택에 반영함을 시사합니다.
- 다만, 연구진은 이 효과가 확정적인 인과관계를 의미하기보다는 정보의 내용(Content)에 따른 강력한 '경향성'을 보여준 것으로 해석해야 한다고 주의를 주었습니다.
본 연구는 언어 모델()이 후보를 선택할 때, 특정 후보가 부족하다고 지목하며 제시하는 '근거'가 실제로 최종 결정에 영향을 미치는지 실험적으로 검증했습니다. 일반적으로 LLM은 경쟁 후보의 프로필에서 누락된 사실(예: 감독이나 사망일 등)을 언급하며 거절합니다. 연구진은 이 가설을 테스트하기 위해, 모델이 지목한 부족한 사실을 담은 실제 코퍼스 문장을 해당 후보의 프로필에 삽입하고 그리디 디코딩 방식으로 재질문했습니다.
가장 큰 규모의 세 가지 실행 중 하나에서, 6개의 모델을 사용하여 2WikiMultihopQA 데이터셋으로 테스트한 결과, 모델이 지목한 사실을 프로필에 제공했을 때 선택 변화 폭이 단순히 무관한 내용을 삽입한 대조군보다 더 크게 나타났습니다. 구체적으로 오즈비(odds ratio)는 3.57 [1.54, 8.26]로 측정되었으며, 이는 모델의 선택에 내용적 정보가 영향을 미칠 수 있음을 시사합니다.
연구진은 이 효과를 검증하기 위해 두 가지 대조군을 설정했습니다. 첫째는 동일한 프로필에 삽입된 길이만 맞춘 무관한 문장이며, 둘째는 모델이 언급하지 않은 세 번째 옵션에 같은 두 문장을 넣은 경우입니다. 분석 결과, 사실 정보를 제공했을 때의 효과가 가장 강력했으며, 심지어 내용적 주장이 없는 완전히 동일한 무관한 문장조차도 지목된 경쟁 후보에서 그렇지 않은 옵션보다 선택 변화를 더 크게 유발하는 경향을 보였습니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 오픈 소스
- 소스 코드를 공개해 누구나 보고 고치고 다시 배포할 수 있게 한 소프트웨어.