별도 메모리 모듈 없이 작동하는 효율적인 영상 기반 행동 모델 — AI 생성 일러스트AI 일러스트
AI 에이전트 연구

별도 메모리 모듈 없이 작동하는 효율적인 영상 기반 행동 모델

SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models

arXiv9월 9일 발표 · 2분 · 심사 전 논문

장기적인 행동 결정에 필요한 과거 정보를 복잡한 메모리 모듈 없이 효과적으로 처리하는 새로운 비전-언어-행동(VLA) 모델입니다.

세 줄 요약arXiv 원문 기반
  1. SimpleMemVLA는 과거 기록을 별도의 압축 과정 없이 타임스탬프가 찍힌 원본 비디오 형식 그대로 백본에 전달하여 정보를 활용합니다.
  2. 일반 제어 환경에서 추가 비용 없이 네 가지 메모리 벤치마크 최고 성능을 달성하며, 기존 전문 모듈 대비 뛰어난 효율성을 입증했습니다.
  3. 복잡한 장치를 제거하고 단일 프레임 수준의 낮은 지연 시간을 유지하면서도 강력한 장기 기억 능력을 구현했다는 점이 핵심입니다.

장기적인 조작(long-horizon manipulation)은 부분적으로 관찰 가능하며, 다음 행동을 결정하는 데 필요한 정보가 몇 분 전의 관측에서 나타날 수 있습니다. 기존 메모리 메커니즘들은 미래에 어떤 결정이 필요할지 알기 전에 과거 기록 중 무엇을 보존할지 결정해야 하는 복잡성을 가집니다.

본 연구에서 제안된 SimpleMem는 별도의 전용 메모리 모듈 없이 VLA를 구현합니다. 이 모델은 샘플링된 과거 기록을 손상 없이 보존하고, 백본이 사전 학습된 타임스탬프 비디오 형식 그대로 전달하여 정보를 활용합니다. 생성된 하위 작업의 은닉 상태가 역사와 표준 흐름 매칭(flow-matching) 액션 헤드 간의 유일한 채널 역할을 수행합니다.

연속적인 결정들은 대부분의 역사를 공유하기 때문에, 행동 실행 중 공유된 접두사(shared prefix)를 미리 채우는 방식은 지연 시간을 단일 프레임 VLA 수준으로 유지할 수 있습니다. SimpleMemVLA는 일반 목적 제어 비용 없이 네 가지 메모리 에서 새로운 최고 성능을 달성했으며, 기존의 검색, 압축 및 순환 상태 메커니즘보다 월등히 뛰어난 성능을 입증했습니다.

용어 풀이

VLA
시각·언어·행동(Vision-Language-Action) 모델. 보고 지시를 이해해 로봇의 동작까지 만들어 내요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · SimpleMemVLA: A Simple but Effective Native-Video Memory for Vision-Language-Action Models같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv