장기 목표를 위한 신경-기호적 로봇 조작 추론 연구 — AI 생성 일러스트AI 일러스트
로보틱스 연구

장기 목표를 위한 신경-기호적 로봇 조작 추론 연구

Towards Neuro-Symbolic Procedural Reasoning for Long-Horizon Vision-Language-Action Manipulation

arXiv9월 4일 발표 · 2분 · 심사 전 논문

기존의 비전-언어-행동(VLA) 모델은 단기 조작에는 강하지만, 지속적인 상태 추적과 조건부 판단이 필요한 장기 목표 수행에 취약했습니다.

세 줄 요약arXiv 원문 기반
  1. 연구진은 행동 의존성을 명시적으로 구조화한 '태스크 그래프'와 다중 모드 메모리를 결합한 신경-기호적 프레임워크를 제안하여 이를 해결했습니다.
  2. 이는 로봇이 단순 시각 정보에만 의존하는 것이 아니라, 논리적 추론과 계획을 통합해 복잡하고 순차적인 장기 목표를 오류 없이 달성할 수 있게 합니다.
  3. 다만 이 방식은 행동 간의 순서와 조건 분기가 명확히 정의된 구조화된 작업 환경(예: 수술, 정리)에서 가장 높은 신뢰성을 보입니다.

비전-언어-행동() 모델은 단기적인 조작 기술 수행에는 강점을 보이지만, 지속적인 작업 상태 유지, 의존성 기반의 추론, 조건부 결정이 필요한 장기 목표 과정에서는 취약성을 드러냅니다. 본 연구는 이러한 한계를 극복하기 위해 학습된 VLA 제어와 명시적인 태스크 그래프 및 다중 모드 절차적 메모리를 결합한 신경-기호적 프레임워크를 제시합니다.

이 프레임워크에서 태스크 그래프는 행동 의존성, 유효한 전환(transition), 그리고 분기 조건을 인코딩하며, 메모리는 현재 활성화된 단계, 완료된 행동, 텍스트 컨텍스트, 작업 관련 시각적 증거 등을 유지합니다. 이러한 구조들은 객체 선택, 목적지 지정, 하위 목표 전송 및 예상 상태 변화 검증을 안내하는 역할을 수행합니다.

연구진은 이 시스템을 워크스페이스 정리와 수술 기구 핸들링 같은 두 가지 장기 조작 도메인에 적용했습니다. 본 연구는 구조화된 상징적 추론과 시연 기반의 시각적 가이드를 결합하는 것이 신뢰성 높은 장기 VLA 조작을 위한 보완적인 메커니즘임을 입증합니다.

용어 풀이

VLA
시각·언어·행동(Vision-Language-Action) 모델. 보고 지시를 이해해 로봇의 동작까지 만들어 내요.
원문arXiv · Towards Neuro-Symbolic Procedural Reasoning for Long-Horizon Vision-Language-Action Manipulation

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv