명시적 궤적 없이 3D 확산 정책의 미래 예측 학습
Learning Foresight without Explicit Trajectories for 3D Diffusion Policies
arXiv로봇 공학의 3D 확산 정책이 현재 동작 예측을 넘어 상호작용의 미래 흐름과 방향성을 미리 예상하도록 개선되었습니다.
- 연구진은 명시적인 계획 없이도 짧은 관찰 기록에서 '상호작용 변화의 잠재적 흐름(latent representation)'을 추출하여 행동 생성에 활용하는 방법을 제시했습니다.
- 이 기법은 RoboTwin2.0, LIBERO-40 등 주요 벤치마크와 실제 로봇 작업에서 기존 모델 대비 현저한 성능 향상을 입증하며 높은 실용성을 보여줍니다.
- 단 3.52%의 파라미터 증가로 구조를 유지하면서도, 명시적 계획 대신 잠재적 흐름 예측을 통해 더욱 능동적인 자율 조작이 가능해진 것이 핵심입니다.
기존의 3D 확산 정책은 현재 관찰을 기반으로 기하학적으로 근거한 동작 생성에 강점을 보이지만, 성공적인 조작을 위해서는 단순히 가능한 움직임을 아는 것을 넘어 상호작용이 어디로 향할지 예측하는 능력이 필요합니다. 연구진은 명시적인 계획(explicit plan) 없이도 이러한 미래 예측 능력(foresight)을 제공하기 위해 'Movement Trend Guidance'라는 방법을 도입했습니다. 이 방법은 짧은 관찰 기록으로부터 상호작용 변화의 압축된 잠재적 표현(latent representation)을 학습합니다.
훈련 과정에서는 희소한 미래 그리퍼 상태(sparse future gripper states)가 이 잠재적 표현을 감독하며, 추론 시에는 현재 관찰과 함께 오직 이 잠재적 흐름만을 미래 지향적인 조건으로 유지합니다. 이 잠재적 값은 동작 생성에 대한 전역적 조건(global conditioning)을 제공하며, UNet 병목 구간에서는 추가적인 게이티드 FiLM 브랜치가 사용됩니다. 이러한 구조는 기존의 밀집 행동 및 후퇴 지평선 공식화(receding-horizon formulation)를 유지하면서도 성능을 개선합니다.
제안된 방법은 다양한 와 실제 로봇 작업에서 높은 성능 향상을 입증했습니다. 예를 들어, RoboTwin2.0 혼합 훈련에서는 62.8%로 기존 대비 56.1%를 기록했으며, LIBERO-40에서는 71.93% 대 37.08%의 수치를 보였습니다. 이러한 결과는 확산 정책이 움직임의 정확한 경로가 주어지지 않아도 상호작용의 방향성을 아는 것이 상당한 이점을 제공함을 보여줍니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.