답변 개선을 위한 '생성 인식 평가' 프레임워크, CriticGen
CriticGen: Generation-Aware Evaluation as Actionable Feedback
arXiv현재 LLM 평가는 답변 생성 과정과 분리된 일반적인 평가를 제공하여, 모델이 실제로 개선할 수 있는 구체적이고 실행 가능한 피드백을 주지 못하는 한계가 있었습니다.
- CriticGen은 평가 과정을 '행동 지침'으로 전환한 프레임워크입니다. 개별 사례에 맞는 다차원적 기준을 적용하여 점수, 근거, 수정 제안, 개선된 답변을 한 번에 제공합니다.
- 단순한 평가 점수 부여를 넘어, 모델이 자체적으로 오류를 진단하고 수정하도록 유도합니다. 실험 결과, 피드백을 받은 답변의 73% 이상에서 신뢰성 있는 개선 효과가 확인되었습니다.
- LLM 평가 시스템은 반드시 개별 입력 사례(Instance-Specific)를 고려하고, 단순한 점수 매기기를 넘어 실제적인 성능 향상으로 연결되는 '실행 가능한 피드백' 제공에 초점을 맞춰야 합니다.
기존의 (LLM) 평가는 생성 과정과 분리되어 이루어지며, 답변 개선에 직접 활용하기 어려운 일반적인 설명만을 제공하는 한계가 있었습니다. 이에 연구진은 평가 과정을 실행 가능한 제어 수단으로 전환한 'CriticGen'이라는 프레임워크를 제안했습니다. CriticGen은 개별 사례(sample-specific)에 맞는 다차원적 평가 차원과 점수 기준을 생성하며, 이를 기반으로 점수, 근거, 실행 가능한 수정 제안, 그리고 개선된 답변을 종합적으로 도출합니다.
CriticGen의 실험 결과에 따르면, 이 프레임워크는 개별 사례 특화적이고 실행 가능성이 높은 평가를 제공하는 것이 중요함을 입증했습니다. CriticGen은 관련성/커버리지(relevance/coverage)를 3.33/4.03에서 3.97/4.24로 향상시켰으며, 피어슨 상관계수와 스피어만 상관계수를 각각 0.9556과 0.9560으로 달성했습니다. 또한 기준 기반 근거 및 실행 가능한 제안의 F1 점수는 0.6369/0.5994에서 0.7554/0.7900로 높아졌습니다.
가장 중요한 점은 CriticGen이 제공하는 피드백이 실제 답변 개선으로 이어진다는 것입니다. 실험 결과, 생성된 피드백을 통해 답변의 73.17%에서 신뢰성 있는 개선 효과를 확인했으며, 이때 답변 품질 저하(non-degradation)율은 93.28%에 달했습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.