VANTAGE-Bench: 인프라 환경 AI 격차 평가 벤치마크
VANTAGE-Bench: Evaluating the Infrastructure AI Gap in Vision-Language Models
arXiv기존의 소비자 중심 영상 분석을 넘어, 안전 모니터링이나 운영 기록 등 고정 카메라 기반 인프라 환경에 특화된 AI 성능을 측정하는 VANTAGE-Bench가 개발되었습니다.
- 17개 모델 테스트 결과, AI 성능 격차는 전반적이라기보다 시간 추론, 사건 검증, 장시간 객체 트래킹 등 특정 영역에 집중되어 있음이 밝혀졌습니다.
- 이는 자율주행 로봇 같은 '움직이는' AI를 넘어, 공장이나 도시의 안전 모니터링처럼 고정된 환경에서의 실질적인 운영 가능성을 평가하는 중요한 기준을 제시합니다.
- 특히 시공간 정보를 종합적으로 추론하는 시간적 위치 파악(temporal localization) 능력은 현재 최고 수준 모델도 어려움을 겪는 가장 취약한 영역으로 확인되었습니다.
비전-언어 모델(VLMs)이 물리적 배포 단계로 발전함에 따라, 안전 모니터링이나 운영 기록과 같은 고정 카메라 기반의 '인프라 AI(Infrastructure AI)' 영역에 대한 평가가 부족했습니다. 이에 연구진은 이러한 "인프라 AI 격차"를 측정하기 위해 VANTAGE-Bench라는 를 개발했습니다. 이 벤치마크는 물류, 교통, 스마트 공간 등 세 가지 운영 도메인을 아우르며, 의미론적, 공간적, 시간적 능력을 통합적으로 평가합니다.
VANTAGE-Bench는 단순한 객관식 질문을 넘어 밀집 캡셔닝이나 시공간 접지(spatio-temporal grounding)를 포함한 총 8가지 과제 구성을 제시했습니다. 이 평가는 총 3,346개의 미디어 자산을 기반으로 하며, 여기에는 비디오-태스크 주석 3,342개와 이미지-접지 주석 4,281개 등이 포함되어 있습니다.
17개의 모델을 으로 평가한 결과, AI 성능의 부족함은 전반적이라기보다 특정 영역에 집중된 것으로 나타났습니다. 특히 시간적 위치 파악 능력이나 밀집 비디오 캡셔닝 같은 분야가 가장 취약점으로 확인되었으며, 현재 최고 수준 모델도 시간적 위치 파악에서 55.7 mIoU를 넘지 못하는 등 성능 격차가 존재했습니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 제로샷
- 예시를 하나도 주지 않고 바로 과제를 시키는 방식.