리서치 연구
시각 언어 모델의 물리적 증거 선택 능력 테스트
New Evidence, Same Choice: Testing Physical Experiment Selection in Vision Language Models
arXiv시각 언어 모델이 주어진 초기 측정값만으로 답할지, 아니면 추가적인 물리 실험을 설계해야 할지 판단하는 의사결정 능력을 평가했습니다.
세 줄 요약
- 모델들은 최종 답변은 높은 정확도를 보였으나, 문제 해결에 필요한 최적의 증거를 선택하는 핵심 물리 추론 능력은 매우 낮은 것으로 나타났습니다.
- 기존 AI 평가는 최종 답변만 측정해왔기 때문에, 모델이 실제로 지능적인 판단 과정을 거치는지 평가하는 데 근본적인 한계가 있었습니다.
- 이번 연구는 측정값 해석, 복잡한 물리 추론 과정, 답변 형식 지정 등 여러 단계에서 모델의 취약점을 명확히 밝혀냈습니다.
(VLM)이 초기 측정 이미지 하나만으로 질문에 답할지, 아니면 추가적인 물리 실험을 수행해야 할지를 판단하는 의사결정 능력을 평가했습니다. 기존의 물리 추론 는 최종 답변만을 평가하여, 모델이 증거를 선택하는 지능적인 결정 과정을 직접적으로 측정하기 어렵다는 한계가 있었습니다.
연구진은 통제된 평가 환경을 구축했으며, 각 문제에는 하나의 측정 이미지와 두 가지 질량 및 다른 관련 속성의 두 가지 값을 조합한 네 가지 가능한 물리 세계가 제공됩니다. 모델은 질문에 답하며 중단하거나, 혹은 질문을 해결할 수 있는 가장 저렴한 추가 실험을 선택해야 하는 과제를 수행합니다.
테스트 결과, 직접적인 답변 방식은 이미지 쌍의 95.1%에서 100% 사이의 비율로 동일한 행동을 반복하는 모습을 보였으나, 올바른 행동이 바뀌는 경우에도 일관성이 떨어졌습니다. 추가 분석에 따르면, 최적의 결정을 내리는 모델조차도 이미지 쌍 중 단 5.9%에서만 답변과 실험 선택이라는 두 가지 결정 모두를 정확하게 수행했습니다.
용어 풀이
- 시각 언어 모델
- 이미지와 글을 함께 이해하는 모델.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.