로봇의 복잡한 추론 능력을 진단하는 대규모 벤치마크 'RoboSPA'
RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?
arXiv로봇의 시각-언어-행동(VLA) 모델이 복잡한 환경에서 추론하는 능력을 진단하기 위해 대규모 벤치마크 'RoboSPA'가 개발되었습니다.
- RoboSPA는 공간적 추론과 장기 절차 계획에 초점을 맞춘 280개 변형 태스크와 52만 개 이상의 트래젝토리를 포함합니다.
- 이 벤치마크를 통해 로봇 에이전트가 단순 임무 완수를 넘어, 복잡한 추론 과정과 문제점을 세밀하게 진단할 수 있는 기준을 제시합니다.
- 실험 결과, 현재 VLA 모델들은 여전히 복잡한 공간 관계 처리와 메모리 집약적인 장기 계획 수립에 어려움을 겪는 것으로 나타났습니다.
시각-언어-행동() 모델은 언어 조건부 로봇 조작 분야에서 유망한 발전을 보여왔지만, 기존의 데이터셋과 는 주로 미리 정의된 환경에서의 태스크 완수만을 평가하여 공간적 및 절차적 복잡성이 증가함에 따른 모델 추론 능력에 대한 통찰이 제한적이었습니다. 이에 연구진은 로봇 의 체화된 추론 능력을 진단하기 위한 대규모 데이터셋이자 벤치마크인 RoboSPA를 소개했습니다.
RoboSPA는 미세한 공간 추론(Fine-Grained Spatial Reasoning)과 장기 절차 계획(Long-Horizon Procedural Planning)이라는 두 가지 핵심 차원에 초점을 맞춥니다. 이 벤치마크는 총 10개의 태스크 카테고리와 56개의 기본 태스크로 구성되어 있으며, 각 태스크를 다섯 단계의 난이도로 구현하여 총 280가지 변형을 제공합니다. 또한 여러 체현체와 다양한 장면에서 수집된 527K 트래젝토리를 포함하고 있습니다.
RoboSPA는 단순한 성공 여부 외에 보다 상세한 평가를 위한 진단 지표를 도입했습니다. 대표적인 VLA 모델들을 대상으로 한 실험 결과, 현재 시스템들은 복잡한 공간 관계 처리, 정밀한 저수준 실행, 그리고 메모리 집약적인 장기 계획 수립 등에서 여전히 어려움을 겪는 것으로 나타났습니다. 이 결과는 RoboSPA가 보다 능숙하고 일반화 가능한 로봇 에이전트 개발을 위한 도전적인 진단 기준임을 입증합니다.
용어 풀이
- VLA
- 시각·언어·행동(Vision-Language-Action) 모델. 보고 지시를 이해해 로봇의 동작까지 만들어 내요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.