리서치 연구
PEA-DPO: Perception-Enhanced Alignment Direct Preference Optimization for MLLMs Alignment
ARarXiv
arXiv 논문이 멀티모달 LLM 정렬에서 DPO의 시각 무감각 문제를 짚고 PEA-DPO를 제안한다.
세 줄 요약
- PEA-DPO는 시각 선호 신호를 명시적으로 활용해 Across-Image Insensitivity와 Within-Image Insensitivity를 완화하고, 세 가지 환각 벤치마크에서 환각을 줄였다.
- 멀티모달 LLM이 시각 맥락을 더 잘 반영하고, 기반 모델의 언어 모델링 능력은 유지되면서 환각이 줄어드는 결과를 확인한다.
- 논문은 세 가지 환각 벤치마크와 다양한 규모의 MLLM으로 평가했고, DPO의 멀티모달 적용이 아직 미개척이라는 전제에서 출발한다.
arXiv 논문이 멀티모달 LLM 정렬에서 DPO의 시각 무감각 문제를 짚고 PEA-DPO를 제안한다.