리서치 연구
Modality Maturity Index: A benchmark for assessing multimodal capabilities of omni models
ARarXiv
기존의 이모달/바이모달 평가 한계를 넘어, 텍스트, 이미지, 오디오 등 5가지 모달리티를 포함하여 최대 세 가지 조합까지 측정하는 신규 벤치마크 'MMI'가 개발되었습니다.
세 줄 요약
- MMI는 총 893개 질문으로 구성되어 모델이 다중 입력 이해와 다양한 출력 형식을 생성하도록 요구하며, 특히 모달리티의 출현 여부를 측정하는 'MPS'가 주요 평가 지표입니다.
- 최근 AI가 '만능 시스템(Omni)'으로 홍보되면서, MMI는 모델의 단순한 성능을 넘어 실질적이고 복합적인 환경에서의 깊이 있는 이해도를 측정하는 객관적 기준으로 활용됩니다.
- 다만, 출력 결과의 정확성을 AI 심사관(LLM judge)으로 자동 채점할 경우, 인간 전문가와의 일치율이 약 70.8% 수준에 머무는 등 자동 평가 시스템의 한계를 확인했습니다.
기존의 이모달/바이모달 평가 한계를 넘어, 텍스트, 이미지, 오디오 등 5가지 모달리티를 포함하여 최대 세 가지 조합까지 측정하는 신규 벤치마크 'MMI'가 개발되었습니다.