역할극 특화 AI 모델 KuaiRP 기술 보고서 — AI 생성 일러스트AI 일러스트
리서치 연구

역할극 특화 AI 모델 KuaiRP 기술 보고서

KuaiRP Series Role-playing Models Technical Report

arXiv9월 12일 발표 · 2분 · 심사 전 논문

KuaiRP는 역할극에 특화된 AI 모델로, 깊이 있는 도메인 지식을 갖추면서도 일반적인 에이전트 능력을 잃지 않도록 설계되었습니다.

세 줄 요약arXiv 원문 기반
  1. 전문 지식 주입으로 인한 능력 저하를 막기 위해, SFT와 RL 학습 후 독자적인 자기 증류(OPD) 기법을 적용하여 일반 능력을 복구하는 다단계 파이프라인을 구축했습니다.
  2. 실험 결과, 특정 도메인 역할극 충실도는 최고 수준의 상용 모델과 동등하며, 낮은 배포 비용으로 높은 실질적 활용도를 입증했습니다.
  3. 이 기술은 단순한 역할극 구현을 넘어, 전문성과 범용성을 동시에 확보하여 AI 에이전트 개발의 새로운 기준을 제시합니다.

KuaiRP 시리즈는 역할극에 최적화된 모델을 목표로 하며, 간소화된 엔지니어링, 높은 출력 안정성, 내장 도메인 지식 확보, 그리고 작은 크기를 통한 고효율 배포를 핵심 목표로 합니다. 다만, 깊은 도메인 지식을 효과적으로 주입하는 과정에서 모델의 일반 기능이 심각하게 망각되는 상충 관계가 발생하여 이를 극복하고자 했습니다.

이를 해결하기 위해 다단계 학습 파이프라인을 구축했습니다. 첫 단계로 표준화된 캐릭터 템플릿과 사용자 행동 시뮬레이션 기반의 SFT 데이터 파이프라인을 설계하고, 다음으로 (RL) 단계에서는 규칙 기반 복합 보상 함수를 활용하여 길이 확장이나 반복 생성 같은 일반적인 성능 저하 현상을 제거했습니다.

마지막으로, SFT와 RL 과정에서 손실된 모델의 일반 능력을 회복하기 위해 Two-stage On-Policy (OPD)과 Cumulative-Divergence Decay (CDD)를 결합한 새로운 자기 증류 패러다임을 제안했습니다. 실험 결과에 따르면, KuaiRP 모델은 목표 도메인 내 역할극 충실도 면에서 현존 최고 수준의 독점 상용 모델과 동등하며, 일반 에이전트 기능까지 성공적으로 복구하여 낮은 배포 비용을 유지하는 것으로 나타났습니다.

용어 풀이

프롬프트
AI에게 주는 지시나 질문 글.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
강화학습
행동의 결과에 보상을 주면서 더 나은 행동을 익히게 하는 학습 방법.
Distillation
큰 모델의 답을 작은 모델이 따라 배우게 해서 가볍고 빠른 모델을 만드는 방법.
원문arXiv · KuaiRP Series Role-playing Models Technical Report같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv