로봇의 개방형 시각 지점화를 위한 벤치마크 Pro-Bench 공개 — AI 생성 일러스트
로보틱스 연구

로봇의 개방형 시각 지점화를 위한 벤치마크 Pro-Bench 공개

Pro-Bench: Prompt-Robust Open-Vocabulary Visual Grounding Across Real-World Heterogeneous Environments

arXiv9월 24일 발표 · 3분 · 프리프린트

로봇이 자연어 질문만으로 실제 환경의 사물을 찾아내는 '개방형 시각 지점화(Visual Grounding)'를 위한 새로운 벤치마크, Pro-Bench가 공개되었습니다.

세 줄 요약arXiv 원문 기반
  1. 테스트 결과, 모델 성능은 프롬프트 유형에 따라 크게 달라지며, 대부분의 모델이 짧고 명확한 카테고리 라벨에서 가장 높은 안정성을 보였습니다.
  2. Pro-Bench는 지하, 산업 현장 등 다양한 실세계 환경을 포함하여 로봇의 성능을 평가함으로써 실제 적용 가능성을 체계적으로 검증합니다.
  3. 단순히 평균 성능 지표(mAP)만으로는 알 수 없는, 다양한 질문 형식에 걸친 목표물 복구 능력의 일관성 차이를 반드시 확인해야 합니다.

로봇이 사전 정의된 분류 체계에 의존하지 않고 자연어 질의만으로 작업 관련 객체를 찾아내는 '개방형 시각 지점화(Open-vocabulary visual grounding)'를 위한 새로운 인 Pro-Bench가 공개되었습니다. 이 벤치마크는 지하, 산업 현장, 실내외 등 다양한 실제 환경을 포함하며, $13k$개가 넘는 RGB 프레임과 $74.5k$개의 수동 인스턴스 주석으로 구성되어 있습니다. 또한 카테고리적, 속성적, 관계적 의미론 등을 포괄하는 $515$개의 목표 질의를 포함하고 있어 광범위한 테스트가 가능합니다.

연구진은 Pro-Bench를 활용하여 $16$가지 개방형 모델 구성을 엄격한 추론 환경에서 평가했습니다. 이 과정에서 단순히 평균 mAP만 측정하는 것을 넘어, 위치 정확도(IoU 임계값), 종단 간 추론 지연 시간, 변화에 따른 성능 변동성 등을 종합적으로 측정했습니다. 테스트 결과, 모델의 성능은 아키텍처에 따라 크게 달라지며, 대부분의 모델이 짧고 명확한 카테고리 라벨에서 가장 높은 안정성을 보였습니다.

특히 Pro-Bench는 집계된 mAP 수치만으로는 파악하기 어려운 목표물 복구 능력의 일관성 차이를 체계적으로 평가할 수 있도록 설계되었습니다. 연구진은 모델들이 짧은 카테고리 라벨에 최적화되는 경향을 보였으며, 자유 형식(free-form) 질의를 사용할 경우에도 높은 정확도를 보이는 경우는 극히 일부임을 확인했습니다. 이는 로봇 시스템이 실제 환경에서 다양한 형태의 자연어 명령을 얼마나 일관되게 처리할 수 있는지 검증하는 데 중요한 기준을 제시합니다.

용어 풀이

벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
제로샷
예시를 하나도 주지 않고 바로 과제를 시키는 방식.
프롬프트
AI에게 주는 지시나 질문 글.
원문arXiv · Pro-Bench: Prompt-Robust Open-Vocabulary Visual Grounding Across Real-World Heterogeneous Environments
원문 보기arXiv