로보틱스 연구

CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators

ARarXiv8월 27일 발표 · 1분 · 심사 전 논문

CLAP은 인간과 로봇의 다양한 영상을 학습하여, 단일 신체에 국한되지 않고 여러 형태에서 동작을 생성하는 혁신적인 비디오 모델입니다.

세 줄 요약arXiv 원문 기반
  1. 말단 장치 자세, 언어 지침, 잠재적 행동을 통합해 이질적인 동작 공간 차이를 극복하며, 별도 학습 없이 실제 작업에 적용 가능한 제로샷 시뮬레이션이 가능합니다.
  2. 로봇이 특정 환경에 구애받지 않고 광범위한 데이터를 통해 보편적인 물리 법칙을 학습하게 함으로써, AI 로봇의 범용성을 근본적으로 높일 전망입니다.
  3. 다양한 형태와 동작 조건을 포괄하며 성능이 뛰어나지만, 효과적인 학습과 배포를 위해서는 대규모의 이질적이고 구조화된 비디오 데이터가 필수적으로 요구됩니다.

CLAP은 인간과 로봇의 다양한 영상을 학습하여, 단일 신체에 국한되지 않고 여러 형태에서 동작을 생성하는 혁신적인 비디오 모델입니다.

원문arXiv · CLAP: Cross-Embodiment Video World Models are Zero-Shot Physical Simulators

평일 아침 메일로 받아 보기 ›틀린 곳 알리기