로봇 학습을 위한 인간 개입형 VLA 모델 개선 프레임워크
HIL-UMI: Bringing Human-in-the-Loop Post-Training of Vision-Language-Action Models to Universal Manipulation Interface
arXiv대규모 비전-언어-행동(VLA) 모델을 특정 환경에 적용할 때 발생하는 한계를 극복하기 위해, 연구진은 물리적 로봇 없이 사람이 개입하는 'HIL-UMI' 프레임워크를 개발했습니다.
- HIL-UMI는 인간의 시연과 현재 정책 추론 간의 차이를 분석하는 에너지 점수를 활용하여, 모델이 취약한 분포 이탈 영역을 찾아내어 학습에 반영합니다.
- 가장 큰 특징은 데이터 수집 과정을 실제 로봇 배포와 분리했다는 점으로, 다양한 작업 환경 및 운영자에게 적용 가능한 높은 확장성을 확보했습니다.
- 실제 복잡한 작업을 수행하는 실험에서 기존 지도학습 방식(SFT) 대비 일관된 성능 향상을 입증하며, VLA 모델의 현장 배포 가능성을 크게 높였습니다.
대규모 비전-언어-행동() 모델은 로봇 조작에 강력한 사전 지식을 제공하지만, 특정 환경에 적용하는 것은 여전히 어렵습니다. 기존의 지도 학습(SFT) 방식은 정적인 데이터만 사용하기 때문에 분포 이탈 상태를 충분히 커버하지 못하며, 표준 모방 목표는 유용한 행동과 그렇지 않은 데이터를 구분할 수 없다는 한계가 있습니다.
연구진이 제안한 HIL-UMI는 물리적 로봇 없이 인간의 개입을 활용하는 정책 기반 범용 조작 인터페이스(UMI) 프레임워크입니다. 이 방식은 사람이 손으로 시연하는 동안, 현재 정책을 실행하지 않고 관찰 스트림에 대해 쿼리합니다. 이때 에너지 점수(Energy Score)를 사용하여 사람 행동 궤적과 정책 추론 간의 불일치를 비교하고, 그 차이가 분포 이탈 영역임을 나타낼 때 데이터 수집을 유도합니다.
또한 HIL-UMI는 온라인 적응 우위 예측(online advantage predictions)이 필수적인 세그먼트를 식별하는 피드백 루프를 통해 개선됩니다. 이는 기본 시연과 새로운 정책 데이터를 균형 있게 혼합하여 Advantage-conditioned behavioral cloning을 수행하며, 데이터 수집 과정을 로봇 배포와 분리합니다. 네 가지 실제 작업에 대한 실험 결과, HIL-UMI는 SFT 대비 일관된 성능 향상을 보였으며, Clean Up Table 작업에서는 HG-DAgger보다 낮은 프레임당 수집 시간을 기록했습니다.
용어 풀이
- VLA
- 시각·언어·행동(Vision-Language-Action) 모델. 보고 지시를 이해해 로봇의 동작까지 만들어 내요.