리서치 연구
Compliance, Capability, and Conflict: Benchmarking Multimodal LLMs under System Messages
ARarXiv
멀티모달 LLM의 시스템 메시지 준수와 기본 능력을 함께 측정하는 벤치마크 VSysBench가 발표됐다.
세 줄 요약
- MMVet-v2 기반 5개 대분류·22개 소분류로 제약을 정리하고, JSR과 CCS로 준수와 정답성을 함께 점수화했다.
- 16개 MLLM에서 시스템 메시지가 기본 정확도를 크게 떨어뜨리고, 사용자 충돌 시 오픈웨이트 모델의 준수가 무너졌다.
- 비전 기반 제약은 모든 모델에서 가장 어렵고, 오픈웨이트와 상위 상용 모델의 충돌 대응이 달랐다.
멀티모달 LLM의 시스템 메시지 준수와 기본 능력을 함께 측정하는 벤치마크 VSysBench가 발표됐다.