로봇의 개방형 시각 지점화를 위한 벤치마크 Pro-Bench 공개
Pro-Bench: Prompt-Robust Open-Vocabulary Visual Grounding Across Real-World Heterogeneous Environments
arXiv로봇이 자연어 질문만으로 실제 환경의 사물을 찾아내는 '개방형 시각 지점화(Visual Grounding)'를 위한 새로운 벤치마크, Pro-Bench가 공개되었습니다.
- 테스트 결과, 모델 성능은 프롬프트 유형에 따라 크게 달라지며, 대부분의 모델이 짧고 명확한 카테고리 라벨에서 가장 높은 안정성을 보였습니다.
- Pro-Bench는 지하, 산업 현장 등 다양한 실세계 환경을 포함하여 로봇의 성능을 평가함으로써 실제 적용 가능성을 체계적으로 검증합니다.
- 단순히 평균 성능 지표(mAP)만으로는 알 수 없는, 다양한 질문 형식에 걸친 목표물 복구 능력의 일관성 차이를 반드시 확인해야 합니다.
로봇이 사전 정의된 분류 체계에 의존하지 않고 자연어 질의만으로 작업 관련 객체를 찾아내는 '개방형 시각 지점화(Open-vocabulary visual grounding)'를 위한 새로운 인 Pro-Bench가 공개되었습니다. 이 벤치마크는 지하, 산업 현장, 실내외 등 다양한 실제 환경을 포함하며, $13k$개가 넘는 RGB 프레임과 $74.5k$개의 수동 인스턴스 주석으로 구성되어 있습니다. 또한 카테고리적, 속성적, 관계적 의미론 등을 포괄하는 $515$개의 목표 질의를 포함하고 있어 광범위한 테스트가 가능합니다.
연구진은 Pro-Bench를 활용하여 $16$가지 개방형 모델 구성을 엄격한 추론 환경에서 평가했습니다. 이 과정에서 단순히 평균 mAP만 측정하는 것을 넘어, 위치 정확도(IoU 임계값), 종단 간 추론 지연 시간, 변화에 따른 성능 변동성 등을 종합적으로 측정했습니다. 테스트 결과, 모델의 성능은 아키텍처에 따라 크게 달라지며, 대부분의 모델이 짧고 명확한 카테고리 라벨에서 가장 높은 안정성을 보였습니다.
특히 Pro-Bench는 집계된 mAP 수치만으로는 파악하기 어려운 목표물 복구 능력의 일관성 차이를 체계적으로 평가할 수 있도록 설계되었습니다. 연구진은 모델들이 짧은 카테고리 라벨에 최적화되는 경향을 보였으며, 자유 형식(free-form) 질의를 사용할 경우에도 높은 정확도를 보이는 경우는 극히 일부임을 확인했습니다. 이는 로봇 시스템이 실제 환경에서 다양한 형태의 자연어 명령을 얼마나 일관되게 처리할 수 있는지 검증하는 데 중요한 기준을 제시합니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 제로샷
- 예시를 하나도 주지 않고 바로 과제를 시키는 방식.
- 프롬프트
- AI에게 주는 지시나 질문 글.