로봇 지능을 위한 이벤트 구조 기반 작업 계획 전처리기 X-Planner — AI 생성 일러스트AI 일러스트
리서치 연구

로봇 지능을 위한 이벤트 구조 기반 작업 계획 전처리기 X-Planner

X-Planner: Event-Structured Task Planning for Embodied Intelligence

arXiv9월 23일 발표 · 2분 · 심사 전 논문

로봇의 복잡한 작업을 위해 고수준 지시와 실제 행동 사이의 추론 과정을 체계적으로 모델링하는 계획 전처리기 'X-Planner'를 제안합니다.

세 줄 요약arXiv 원문 기반
  1. X-Planner는 해석 가능한 '이벤트 상태'를 출력하는 이산 인터페이스와 연속적인 사고 과정(CoT)을 처리하는 잠재 인터페이스를 결합한 것이 핵심입니다.
  2. 단순 실행을 넘어 오류 발생 시 스스로 인지하고 계획을 재구성하는 '오류 인식' 기능을 통합했으며, 실제 로봇 환경에서 최고 성능을 입증했습니다.
  3. 자율주행(Ego), 사용자 모션 등 다양한 출처의 데이터를 계층적으로 결합하여 학습했기에, 정교한 다중 데이터와 주석 작업이 필수적입니다.

X-Planner는 고수준의 명령어와 장기적인 조작 행동 사이의 추론 과정을 체계적으로 모델링하는 계획 전처리기를 제안합니다. 기존의 Vision-Language-Action () 시스템들이 이러한 중간 구조를 암묵적으로 처리하거나, CoT 플래너가 거친 작업 수준 주석에 의존하는 한계를 극복하기 위해 설계되었습니다.

이 계획 전처리는 로봇의 체화된 추론(embodied reasoning)을 위한 감독 및 표현 방식을 다룹니다. 데이터 측면에서는 Ego, UMI, 그리고 원격 조작 데이터를 계층적 세분성으로 결합하고 출처에 따라 주석 깊이를 달리했습니다. 모델 구조는 공유 백본을 활용하여 해석 가능한 이산 이벤트 상태를 출력하는 인터페이스와 연속적인 CoT 상태를 전달하는 잠재 인터페이스(Staircase Decoding 사용) 두 가지 형태의 계획을 노출합니다.

X-Planner는 단순한 실행 과정을 넘어, 오작동 시 스스로 오류를 인식하고 계획을 재구성할 수 있도록 합니다. 이는 인수 시간 주석 및 사람이 설계한 실패 사례로 감독됩니다. 평가 결과에 따르면, X-Planner는 BERTSco-re-F1과 심사 기반 종합 점수 모두에서 기존 모델들을 능가했으며, 실제 로봇 실험에서도 우수한 성능을 입증했습니다.

용어 풀이

VLA
시각·언어·행동(Vision-Language-Action) 모델. 보고 지시를 이해해 로봇의 동작까지 만들어 내요.
VLM
이미지와 글을 함께 이해하는 모델.
원문arXiv · X-Planner: Event-Structured Task Planning for Embodied Intelligence같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv