AI 에이전트 연구
별도 메모리 모듈 없이 작동하는 효율적인 영상 기반 행동 모델
SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models
arXiv장기적인 행동 결정에 필요한 과거 정보를 복잡한 메모리 모듈 없이 효과적으로 처리하는 새로운 비전-언어-행동(VLA) 모델입니다.
세 줄 요약
- SimpleMemVLA는 과거 기록을 별도의 압축 과정 없이 타임스탬프가 찍힌 원본 비디오 형식 그대로 백본에 전달하여 정보를 활용합니다.
- 일반 제어 환경에서 추가 비용 없이 네 가지 메모리 벤치마크 최고 성능을 달성하며, 기존 전문 모듈 대비 뛰어난 효율성을 입증했습니다.
- 복잡한 장치를 제거하고 단일 프레임 수준의 낮은 지연 시간을 유지하면서도 강력한 장기 기억 능력을 구현했다는 점이 핵심입니다.
장기적인 조작(long-horizon manipulation)은 부분적으로 관찰 가능하며, 다음 행동을 결정하는 데 필요한 정보가 몇 분 전의 관측에서 나타날 수 있습니다. 기존 메모리 메커니즘들은 미래에 어떤 결정이 필요할지 알기 전에 과거 기록 중 무엇을 보존할지 결정해야 하는 복잡성을 가집니다.
본 연구에서 제안된 SimpleMem는 별도의 전용 메모리 모듈 없이 VLA를 구현합니다. 이 모델은 샘플링된 과거 기록을 손상 없이 보존하고, 백본이 사전 학습된 타임스탬프 비디오 형식 그대로 전달하여 정보를 활용합니다. 생성된 하위 작업의 은닉 상태가 역사와 표준 흐름 매칭(flow-matching) 액션 헤드 간의 유일한 채널 역할을 수행합니다.
연속적인 결정들은 대부분의 역사를 공유하기 때문에, 행동 실행 중 공유된 접두사(shared prefix)를 미리 채우는 방식은 지연 시간을 단일 프레임 VLA 수준으로 유지할 수 있습니다. SimpleMemVLA는 일반 목적 제어 비용 없이 네 가지 메모리 에서 새로운 최고 성능을 달성했으며, 기존의 검색, 압축 및 순환 상태 메커니즘보다 월등히 뛰어난 성능을 입증했습니다.
용어 풀이
- VLA
- 시각·언어·행동(Vision-Language-Action) 모델. 보고 지시를 이해해 로봇의 동작까지 만들어 내요.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.