VLA 정책의 행동 구간을 적응적으로 조절하는 GeoAAC 기술
GeoAAC: Geometry-Based Adaptive Action Chunking from Denoising Trajectories in VLA Policies
arXiv기존 VLA 정책의 고정된 행동 구간(action horizon) 문제를 해결하기 위해, GeoAAC는 예측 신뢰도에 따라 행동 단위를 적응적으로 조절하는 방식을 제안했습니다.
- 이 방법은 흐름 매칭 궤적의 기하학적 특성을 활용하여 예측 불확실성을 파악하며, 시뮬레이션에서 최대 8.7%p 향상 등 뛰어난 성능을 입증했습니다.
- 로봇 공학 분야에서 상황 변화에 맞춰 제어 정밀도를 유연하게 조절하는 능력은 필수적이므로, 이 기술은 실제 산업 현장 적용 가능성을 크게 높입니다.
- GeoAAC는 흐름 기반 VLA 정책에 적용되며, 추가적인 학습 없이도 행동 구간을 적응적으로 결정할 수 있다는 것이 핵심 장점입니다.
기존의 비전-언어-행동() 정책에서 사용되는 액션 청킹 방식은 일반적으로 고정된 행동 지평(fixed action horizon)을 사용합니다. 하지만 실제 작업 수행 과정에서는 과제 단계별로 요구되는 제어 정밀도나 폐쇄 루프 피드백 수준이 달라지기 때문에, 고정된 지평만으로는 변화하는 제어 요구사항을 수용하기 어렵다는 문제가 있습니다.
이에 연구진은 흐름 기반 VLA 정책을 위한 기하학적 적응형 액션 청킹 방법인 GeoAAC를 제안했습니다. 이 방식은 현재 행동 예측의 신뢰도에 따라 액션 지평을 조절하며, Flow Matching 디노이징 궤적의 기하학적 특성을 활용하여 예측 신뢰도를 파악합니다. 특히, 액션 접두사(action prefixes) 전반의 기하학적 변화가 예측 불확실성과 양의 상관관계를 가진다는 점을 이용합니다.
GeoAAC는 이 접두사별 기하학 정보를 바탕으로 지평별 기하학 프로파일을 구성하고, 추가적인 학습 없이도 단일 생성 과정에서 액션 지평을 적응적으로 결정할 수 있습니다. LIBERO, RoboCasa365 등 다양한 시뮬레이션 및 실제 조작 작업 환경에서의 실험 결과, 기존 고정 지평 방식이나 다른 적응형 방법들 대비 일관된 성능 향상을 보였습니다. 구체적으로 시뮬레이션에서 최대 8.7%p의 개선을 달성했으며, 평균 실세계 성공률은 53.3%에서 74.4%로 증가했습니다.
용어 풀이
- VLA
- 시각·언어·행동(Vision-Language-Action) 모델. 보고 지시를 이해해 로봇의 동작까지 만들어 내요.