월드-액션 모델(WAM) 개발을 위한 개방형 연구 스택
OpenWAM-Official/OpenWAM
GitHubOpenWAM은 월드-액션 모델 개발을 위한 개방형 연구 스택입니다. 인프라 구축부터 체계적인 학술 방법론, 대규모 사전 학습 모델까지 포괄적으로 제공합니다.
- 핵심은 복잡하게 결합된 설계 요소를 모듈화하여, 모델 구조부터 학습/배포 과정까지 독립적이고 통제된 방식으로 비교하고 개선할 수 있다는 점입니다.
- 로봇 공학 및 에이전트 학습 분야에서 월드 지식과 행동 학습을 체계적으로 결합하는 원리를 연구하며, 다양한 환경의 성능 검증 표준화 기반을 제공합니다.
- 다양한 백본과 다수의 벤치마크를 지원하여 활용 범위가 넓지만, 실제 학습 및 구동에는 고성능 GPU 자원과 복잡한 시스템 설정 이해가 필수적입니다.
OpenWAM은 월드-액션 모델(World-Action Models, WAMs)을 체계적으로 개발하기 위해 설계된 개방형 연구 스택입니다. 이 시스템은 복잡하게 결합된 여러 설계 선택들을 모듈화하고 통제된 실험 환경으로 분리하여 비교할 수 있게 합니다. 주요 구성 요소로는 모델, 표현, 학습, 추론, 배포를 포괄하는 OpenWAM-Infra가 있으며, 518.5M 프레임(약 6,400시간)의 에고센트릭 인간 및 로봇 데이터로 사전 학습된 OpenWAM-α도 제공합니다.
OpenWAM은 다양한 아키텍처를 지원하며, `single_system`, `dual_system`, `tri_system` 등의 변형을 통해 WAM 구조를 구현할 수 있습니다. 예를 들어, `dual_system`의 경우 별도의 ActionDiT와 video DiT를 사용하고, 이를 하나의 혼합 셀프 어텐션(MoT driver)으로 융합하는 방식이 가능합니다. 또한, Video Backbone으로는 Wan2.2-TI2V-5B 같은 여러 옵션을 선택할 수 있으며, 백본으로는 Qwen3-VL-2B-Instruct를 활용하여 이해 능력을 추가할 수도 있습니다.
시스템은 광범위한 평가 환경을 지원하며, RoboTwin eval (50개 태스크), LIBERO-plus eval, RoboCasa365 eval, VLABench eval 등 다양한 표준화된 를 통해 성능 검증이 가능합니다. 사용자는 Docker 컨테이너 또는 네이티브 Python 환경 중 하나를 선택하여 설치할 수 있으며, 학습 및 배포 과정에서는 고성능 자원 확보가 권장됩니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
- GPU
- 많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.