MLLM의 환각 현상을 줄이는 새로운 강화 학습 방법론 — AI 생성 일러스트AI 일러스트
리서치 연구

MLLM의 환각 현상을 줄이는 새로운 강화 학습 방법론

DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs

arXiv9월 25일 발표 · 1분 · 심사 전 논문

대규모 멀티모달 언어 모델(MLLMs)의 고질적인 문제인 '환각 현상'을 줄이는 새로운 강화 학습 최적화 기법, DEEPO가 제안되었습니다.

세 줄 요약arXiv 원문 기반
  1. DEEPO는 신호 분산 정규화와 기울기 사전 조건화를 결합한 2단계 방식을 통해, 모델이 취약한 부분에 직접적인 지침과 보정력을 제공합니다.
  2. 특히 복잡하고 긴 과정의 추론(VideoMMMU 등)에서 환각률을 효과적으로 낮추면서도 전반적인 정확도와 학습 안정성을 유지하는 것이 강점입니다.
  3. 두 가지 핵심 구성 요소가 개별 성능 개선을 넘어, 상호작용 시 통계적으로 유의미한 추가적 성능 향상을 보인다는 점이 주목할 만합니다.

대규모 멀티모달 언어 모델(MLLMs)의 고질적인 문제인 '환각 현상'을 줄이는 새로운 강화 학습 최적화 기법, DEEPO가 제안되었습니다.

원문arXiv · DEEPO: Dual-Entropy Enhanced Policy Optimization for Hallucination in MLLMs같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv