행동 구별 세계 모델을 활용한 반사실적 MPC 제어 연구
AD-WM: Action-Discriminative World Models for Counterfactual Model Predictive Control
arXiv기존 세계 모델은 실제 발생할 상황 예측에만 집중했지만, 로봇 제어(MPC)는 여러 가상 행동을 비교해야 합니다. 본 연구의 AD-WM은 이 간극을 메우기 위해 '행동 구별' 능력을 갖춘 새로운 프레임워크를 제시했습니다.
- AD-WM은 역학 모델과 조건부 상호 정보 기반 정규화를 통해 행동 정보를 보존하며 학습합니다. 그 결과, OGBench-Cube에서 하드 스타트 성공률을 3.7%에서 52.0%까지 크게 끌어올렸습니다.
- 이 연구는 로봇 계획에 사용되는 세계 모델의 핵심은 단순히 사실적 예측 정확도를 높이는 것이 아니라, 가상 행동들 간의 차이를 보존하는 데 있음을 명확히 보여줍니다.
- 따라서 미래의 세계 모델은 '무엇이 일어날지'를 넘어, 주어진 상태에서 '어떤 행동을 해야 최적인지'를 구별할 수 있도록 설계되어야 합니다.
기존의 잠재 공간(latent) 세계 모델들은 주로 사실적인 전이(factual transitions)를 예측하도록 훈련되어 왔습니다. 그러나 모델 예측 제어(MPC)는 현재 상태에서 여러 대안 행동들을 비교해야 하는 반사실적 상황을 다루어야 합니다. 본 연구에서는 이러한 간극을 메우기 위해, AD-WM이라는 행동 구별 결합 세계 모델을 제시했습니다. 이 모델은 잔여 잠재 역학에 예측자 수준의 행동 복구 정규화(action-recovery regularization)를 결합하여 반사실적 MPC에 활용됩니다.
AD-WM은 조건부 상호 정보(conditional mutual information)에 기반한 정규화를 사용하여 계획 전이가 행동 정보를 보존하도록 장려합니다. 이 방법론을 OGBench-Cube 환경에 적용했을 때, AD-WM은 매칭된 LeWM 기준선 대비 하드 스타트 성공률을 3.7%에서 52.0%로 향상시켰으며, 다섯 가지 시뮬레이션 환경 중 네 곳에서 평균 성공률 개선을 보였습니다.
나아가 OID 후 학습(post-training) 과정을 거친 AD-WM은 별도의 실험실 적응 없이도 Franka 장비에 대한 전이 성능을 보여주었습니다. 기본적인 픽앤플레이스 성공률이 42.2%에서 71.1%까지 증가한 결과는, 계획용 세계 모델이 단순히 사실적 예측 정확도를 최적화하기보다 반사실적 선택에 필요한 행동 의존적 차이를 보존해야 함을 시사합니다.
용어 풀이
- 임베딩
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- 제로샷
- 예시를 하나도 주지 않고 바로 과제를 시키는 방식.