모델 연구
RENDER: Controlling Reader-Facing Evidence in LLM Memory Evaluation
ARarXiv
RENDER는 LLM 메모리 평가에서 독자에게 제시되는 증거(reader-facing evidence)를 제어하는 벤치마크이다.
세 줄 요약
- 이 벤치마크는 대화 내용을 고정하고 다양한 아티팩트를 적용하며, 500개 질문 중 매칭된 예산 패킷은 최신성으로 잘린 원본 대화보다 42.4~72.6점 높았다.
- 챗GPT 스타일 항목은 9개 모델 중 7개에서 원본 대화보다 높은 점수를 기록했으며, 공식 장부 패킷에서 0점을 받은 세 모델도 자연어 항목에서 동일한 사실을 45.4~53.4%로 답변한다.
- 메모리/RAG 평가는 독자에게 제시되는 아티팩트를 보고하거나 제어할 필요가 있으며, 이 효과는 검색 노이즈 하에서도 지속된다.
RENDER는 LLM 메모리 평가에서 독자에게 제시되는 증거(reader-facing evidence)를 제어하는 벤치마크이다.