수중 로봇 구조를 위한 객체 중심 다중 시점 예측 모델
Underwater C3-JEPA: An Object-Centric Cross-View World Model for ROV Salvage
arXiv수중 로봇(ROV) 구조 작업을 위해 객체 중심의 다중 시점 예측 세계 모델인 Underwater C3-JEPA를 개발했습니다.
- 이 모델은 접촉 센서 없이도 여러 카메라 영상과 로봇 제어 신호만으로 물의 흐름 지연까지 고려하여 작업 객체의 미래 상태를 예측합니다.
- 실제 수중 환경에서 검증되었으며, 이 예측 인터페이스는 모델 예측 제어(MPC)나 에이전트 훈련 등 다양한 로봇 제어 시스템에 활용 가능합니다.
- 객체 중심 토큰을 활용하여 작업 관련 정보를 효과적으로 추출하며, 복잡한 환경에서도 높은 예측 정확도를 유지하는 것이 핵심 강점입니다.
Underwater C$^{3}$-JEPA는 근거리 대형 하중 수중 ROV 구조 작업을 위해 개발된 객체 중심의 다중 시점 예측 세계 모델입니다. 이 모델은 접촉 센서 없이도, 동기화된 다중 시점 RGB 관측 영상과 차량 제어 신호만을 활용하여 작업-객체의 상태가 접촉 상호작용 및 수력학적 지연을 거치며 어떻게 진화할지 잠재 공간에서 예측합니다.
C$^{3}$-JEPA는 다중 카메라 관측 데이터를 작업-객체 과 컨텍스트 토큰으로 인코딩하며, 'held-out-view attention' 메커니즘을 통해 교차 카메라 증거를 융합합니다. 이 모델은 제어 신호에 조건화되어 미래 상태를 직접 예측할 수 있으며, 낮은 주석 비용으로 타겟 및 그리퍼를 고정하는 약한 결속(weak binding)과 기하학적 표현을 정교하게 하는 SIGReg 등의 기술을 사용했습니다.
실험 결과에 따르면, 학습된 표현은 재구성 기반의 잠재선형 모델 대비 작업 관련 정보를 훨씬 더 많이 다운스트림 프로브로 전달할 수 있음이 입증되었습니다. 이 예측 인터페이스는 모델 예측 제어(MPC) 후보 평가나 가상 롤아웃 행동 훈련을 지원합니다. 실제 수중 비디오에 대한 검증에서도, 동일한 아키텍처가 누락된 카메라의 객체 상태를 복구하고 지속성을 유지하는 능력을 보여주며 시뮬레이션을 넘어선 전이가 가능함을 입증했습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.