모델 연구
Retrieval, Scoring, and Decoding Shape Performance and Stability in LLM-based Conversational Recommendation
ARarXiv
LLM 기반 추천 모델의 성능은 단순히 모델 자체보다 '어떻게' 평가했는지(검색/추론 프로토콜)에 크게 좌우됨을 보여줍니다.
세 줄 요약
- 추천 시스템의 성능 측정은 매우 민감하여, 후보군 추출 방식이나 풀 크기 같은 세부 설정 변화만으로도 결과가 50% 이상 달라질 수 있습니다.
- 따라서 LLM 기반 추천기를 평가할 때는 모델의 절대적 성능뿐만 아니라, 검색 방식과 스코어링 정책 등 전체 파이프라인을 종합적으로 봐야 합니다.
- 연구 결과를 발표하거나 시스템을 구축할 때는 후보군 생성, 풀 사이즈, 디코딩 온도 등 모든 평가 조건을 빠짐없이 명시하는 것이 필수적입니다.
LLM 기반 추천 모델의 성능은 단순히 모델 자체보다 '어떻게' 평가했는지(검색/추론 프로토콜)에 크게 좌우됨을 보여줍니다.