로봇의 복잡한 추론 능력을 진단하는 대규모 벤치마크 'RoboSPA' — AI 생성 일러스트AI 일러스트
로보틱스 연구

로봇의 복잡한 추론 능력을 진단하는 대규모 벤치마크 'RoboSPA'

RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?

arXiv9월 4일 발표 · 3분 · 심사 전 논문

로봇의 시각-언어-행동(VLA) 모델이 복잡한 환경에서 추론하는 능력을 진단하기 위해 대규모 벤치마크 'RoboSPA'가 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. RoboSPA는 공간적 추론과 장기 절차 계획에 초점을 맞춘 280개 변형 태스크와 52만 개 이상의 트래젝토리를 포함합니다.
  2. 이 벤치마크를 통해 로봇 에이전트가 단순 임무 완수를 넘어, 복잡한 추론 과정과 문제점을 세밀하게 진단할 수 있는 기준을 제시합니다.
  3. 실험 결과, 현재 VLA 모델들은 여전히 복잡한 공간 관계 처리와 메모리 집약적인 장기 계획 수립에 어려움을 겪는 것으로 나타났습니다.

시각-언어-행동() 모델은 언어 조건부 로봇 조작 분야에서 유망한 발전을 보여왔지만, 기존의 데이터셋과 는 주로 미리 정의된 환경에서의 태스크 완수만을 평가하여 공간적 및 절차적 복잡성이 증가함에 따른 모델 추론 능력에 대한 통찰이 제한적이었습니다. 이에 연구진은 로봇 의 체화된 추론 능력을 진단하기 위한 대규모 데이터셋이자 벤치마크인 RoboSPA를 소개했습니다.

RoboSPA는 미세한 공간 추론(Fine-Grained Spatial Reasoning)과 장기 절차 계획(Long-Horizon Procedural Planning)이라는 두 가지 핵심 차원에 초점을 맞춥니다. 이 벤치마크는 총 10개의 태스크 카테고리와 56개의 기본 태스크로 구성되어 있으며, 각 태스크를 다섯 단계의 난이도로 구현하여 총 280가지 변형을 제공합니다. 또한 여러 체현체와 다양한 장면에서 수집된 527K 트래젝토리를 포함하고 있습니다.

RoboSPA는 단순한 성공 여부 외에 보다 상세한 평가를 위한 진단 지표를 도입했습니다. 대표적인 VLA 모델들을 대상으로 한 실험 결과, 현재 시스템들은 복잡한 공간 관계 처리, 정밀한 저수준 실행, 그리고 메모리 집약적인 장기 계획 수립 등에서 여전히 어려움을 겪는 것으로 나타났습니다. 이 결과는 RoboSPA가 보다 능숙하고 일반화 가능한 로봇 에이전트 개발을 위한 도전적인 진단 기준임을 입증합니다.

용어 풀이

VLA
시각·언어·행동(Vision-Language-Action) 모델. 보고 지시를 이해해 로봇의 동작까지 만들어 내요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
원문arXiv · RoboSPA: Can VLA Models Go Beyond Simple Scenes and Short-Horizon Tasks?

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv