월드-액션 모델(WAM) 개발을 위한 개방형 연구 스택 — AI 생성 일러스트AI 일러스트
AI 에이전트 도구

월드-액션 모델(WAM) 개발을 위한 개방형 연구 스택

OpenWAM-Official/OpenWAM

GitHub9월 12일 업데이트 · 3분

OpenWAM은 월드-액션 모델 개발을 위한 개방형 연구 스택입니다. 인프라 구축부터 체계적인 학술 방법론, 대규모 사전 학습 모델까지 포괄적으로 제공합니다.

세 줄 요약GitHub 원문 기반
  1. 핵심은 복잡하게 결합된 설계 요소를 모듈화하여, 모델 구조부터 학습/배포 과정까지 독립적이고 통제된 방식으로 비교하고 개선할 수 있다는 점입니다.
  2. 로봇 공학 및 에이전트 학습 분야에서 월드 지식과 행동 학습을 체계적으로 결합하는 원리를 연구하며, 다양한 환경의 성능 검증 표준화 기반을 제공합니다.
  3. 다양한 백본과 다수의 벤치마크를 지원하여 활용 범위가 넓지만, 실제 학습 및 구동에는 고성능 GPU 자원과 복잡한 시스템 설정 이해가 필수적입니다.

OpenWAM은 월드-액션 모델(World-Action Models, WAMs)을 체계적으로 개발하기 위해 설계된 개방형 연구 스택입니다. 이 시스템은 복잡하게 결합된 여러 설계 선택들을 모듈화하고 통제된 실험 환경으로 분리하여 비교할 수 있게 합니다. 주요 구성 요소로는 모델, 표현, 학습, 추론, 배포를 포괄하는 OpenWAM-Infra가 있으며, 518.5M 프레임(약 6,400시간)의 에고센트릭 인간 및 로봇 데이터로 사전 학습된 OpenWAM-α도 제공합니다.

OpenWAM은 다양한 아키텍처를 지원하며, `single_system`, `dual_system`, `tri_system` 등의 변형을 통해 WAM 구조를 구현할 수 있습니다. 예를 들어, `dual_system`의 경우 별도의 ActionDiT와 video DiT를 사용하고, 이를 하나의 혼합 셀프 어텐션(MoT driver)으로 융합하는 방식이 가능합니다. 또한, Video Backbone으로는 Wan2.2-TI2V-5B 같은 여러 옵션을 선택할 수 있으며, 백본으로는 Qwen3-VL-2B-Instruct를 활용하여 이해 능력을 추가할 수도 있습니다.

시스템은 광범위한 평가 환경을 지원하며, RoboTwin eval (50개 태스크), LIBERO-plus eval, RoboCasa365 eval, VLABench eval 등 다양한 표준화된 를 통해 성능 검증이 가능합니다. 사용자는 Docker 컨테이너 또는 네이티브 Python 환경 중 하나를 선택하여 설치할 수 있으며, 학습 및 배포 과정에서는 고성능 자원 확보가 권장됩니다.

용어 풀이

VLM
이미지와 글을 함께 이해하는 모델.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
GPU
많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
원문GitHub · OpenWAM-Official/OpenWAM같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기GitHub