리서치 연구
MLLM의 환각 현상을 줄이는 새로운 강화 학습 방법론
DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs
arXiv대규모 멀티모달 언어 모델(MLLMs)의 고질적인 문제인 '환각 현상'을 줄이는 새로운 강화 학습 최적화 기법, DEEPO가 제안되었습니다.
세 줄 요약
- DEEPO는 신호 분산 정규화와 기울기 사전 조건화를 결합한 2단계 방식을 통해, 모델이 취약한 부분에 직접적인 지침과 보정력을 제공합니다.
- 특히 복잡하고 긴 과정의 추론(VideoMMMU 등)에서 환각률을 효과적으로 낮추면서도 전반적인 정확도와 학습 안정성을 유지하는 것이 강점입니다.
- 두 가지 핵심 구성 요소가 개별 성능 개선을 넘어, 상호작용 시 통계적으로 유의미한 추가적 성능 향상을 보인다는 점이 주목할 만합니다.
대규모 멀티모달 언어 모델(MLLMs)의 고질적인 문제인 '환각 현상'을 줄이는 새로운 강화 학습 최적화 기법, DEEPO가 제안되었습니다.