희소 피드백 환경에서 LLM을 지속적으로 개인화하는 COPE 프레임워크
COPE: Continual Personalization of LLMs under Sparse User Feedback via User Embeddings and Self-Evaluation
arXivLLM의 일반화된 응답 한계를 극복하기 위해, 희소한 사용자 피드백 환경에서 모델을 지속적으로 개인화하는 COPE 프레임워크를 제안했습니다.
- COPE는 사용자별 임베딩과 자체 평가 기능을 결합하여, 명시적 피드백 없이도 스스로 보상을 생성하며 모델을 끊임없이 최적화합니다.
- 이는 LLM이 실제 사용자의 다양한 선호도에 맞춰 모델을 지속적으로 개선할 수 있게 하여, 실질적인 개인화 경험을 제공하는 데 핵심적입니다.
- 특히 피드백이 부족한 상황(Sparse Feedback)에서도 높은 성능을 보이며, 변화하는 선호도에 대한 안정성과 신뢰성을 입증했습니다.
(LLMs)은 다양한 에서 뛰어난 성능을 보이지만, 종종 사용자 선호도에 관계없이 균질한 응답을 생성하여 다양한 사용자의 요구를 충족시키지 못하는 한계가 있습니다. 기존의 학습 기반 방법들은 일반적으로 학습 후 정적이며, 실제 환경에서 필요한 지속적인 최적화(continual optimization)를 지원하기 어렵다는 문제가 있었습니다.
이러한 문제를 해결하고자 COPE(Continual Optimization with Personalized and self-Evaluation)라는 새로운 프레임워크가 제안되었습니다. 이 방법은 사용자별로 학습 가능한 개인화 임베딩을 할당하고, 선호도 포착, 자체 평가 보정, 그리고 개인화된 응답 최적화를 단일 업데이트 단계에 통합합니다.
COPE의 핵심 혁신은 자체 평가(self-evaluation)를 활용하여 프록시 보상(proxy rewards)을 생성하는 것입니다. 이를 통해 명시적인 사용자 피드백이 부족한 희소 피드백 환경에서도 모델을 지속적으로 최적화할 수 있습니다. 실험 결과, COPE는 희소 피드백 조건에서 강력한 학습 기반 및 비학습 기반 기준 모델들을 일관되게 능가하며 안정성을 입증했습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- embedding
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.