리서치 연구

PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment

ARarXiv8월 21일 발표 · 1분 · 심사 전 논문

arXiv 논문이 멀티모달 LLM 정렬에서 DPO의 시각 무감각 문제를 짚고 PEA-DPO를 제안한다.

세 줄 요약arXiv 원문 기반
  1. PEA-DPO는 시각 선호 신호를 명시적으로 활용해 Across-Image Insensitivity와 Within-Image Insensitivity를 완화하고, 세 가지 환각 벤치마크에서 환각을 줄였다.
  2. 멀티모달 LLM이 시각 맥락을 더 잘 반영하고, 기반 모델의 언어 모델링 능력은 유지되면서 환각이 줄어드는 결과를 확인한다.
  3. 논문은 세 가지 환각 벤치마크와 다양한 규모의 MLLM으로 평가했고, DPO의 멀티모달 적용이 아직 미개척이라는 전제에서 출발한다.

arXiv 논문이 멀티모달 LLM 정렬에서 DPO의 시각 무감각 문제를 짚고 PEA-DPO를 제안한다.

원문arXiv · PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기