리서치 연구

Compliance, Capability, and Conflict: Benchmarking Multimodal LLMs under System Messages

ARarXiv8월 21일 발표 · 1분 · 심사 전 논문

멀티모달 LLM의 시스템 메시지 준수와 기본 능력을 함께 측정하는 벤치마크 VSysBench가 발표됐다.

세 줄 요약arXiv 원문 기반
  1. MMVet-v2 기반 5개 대분류·22개 소분류로 제약을 정리하고, JSR과 CCS로 준수와 정답성을 함께 점수화했다.
  2. 16개 MLLM에서 시스템 메시지가 기본 정확도를 크게 떨어뜨리고, 사용자 충돌 시 오픈웨이트 모델의 준수가 무너졌다.
  3. 비전 기반 제약은 모든 모델에서 가장 어렵고, 오픈웨이트와 상위 상용 모델의 충돌 대응이 달랐다.

멀티모달 LLM의 시스템 메시지 준수와 기본 능력을 함께 측정하는 벤치마크 VSysBench가 발표됐다.

원문arXiv · Compliance, Capability, and Conflict: Benchmarking Multimodal LLMs under System Messages같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기