VLA 모델을 위한 방향-크기 분해 기반 행동 표현 연구 — AI 생성 일러스트AI 일러스트
리서치 연구

VLA 모델을 위한 방향-크기 분해 기반 행동 표현 연구

Direction-Scale Decomposition in Action Representation: Rethinking What to Tokenize for Vision-Language-Action Models

arXiv9월 25일 발표 · 3분 · 심사 전 논문

기존 행동 표현 방식은 실행 속도나 데이터셋에 민감하여 움직임의 기하학적 구조를 놓치는 문제가 있었습니다. 이를 해결하기 위해 '방향-크기 분해(DSD)'라는 새로운 행동 표현 방식을 제안했습니다.

세 줄 요약arXiv 원문 기반
  1. DSD는 이동 및 회전 변화를 방향과 크기로 분리하여 토큰화하는 방식입니다. 이로 인해 다양한 데이터셋을 혼합 학습할 때 기존 방법 대비 높은 성공률 개선 효과가 확인되었습니다.
  2. 이 기술은 대규모의 다양하고 복잡한 데이터를 다루는 비전-언어-행동(VLA) 모델이 성능 저하 없이 일반화하는 데 핵심적인 해결책을 제시합니다.
  3. DSD는 이산 토큰 기반 VLA 모델에 효과적이나, 실제 로봇 환경 적용 시에는 사전 학습 여부와 사용된 특정 토크나이저 조합 등 조건 확인이 필요합니다.

비전-언어-행동() 학습에서 행동 표현은 핵심적인 역할을 하지만, 기존의 포즈 증가분 방식으로는 실행 속도나 데이터셋별 정규화에 민감하여 모든 시연과 데이터셋 간에 공유되는 기하학적 구조를 놓치는 문제가 있었습니다. 이러한 문제를 해결하기 위해 연구진은 방향-크기 분해(Direction-Scale Decomposition, DSD)라는 새로운 행동 표현 방식을 제안했습니다.

DSD는 이동 및 회전 증가분을 각각 방향과 크기로 분리하여 화하는 방식입니다. 이 접근법을 통해 움직임의 방향성을 격리하고, 그 크기 정보는 별도의 스케일 채널로 유지할 수 있습니다. 연구진은 DSD를 균일 빈(BIN) 및 B-스플라인 기반 인 BEAST와 함께 시뮬레이션 환경과 실제 조작 환경에서 단일 데이터셋 및 혼합 데이터셋 학습 조건으로 평가했습니다.

평가 결과, LIBERO 데이터셋에서는 DSD가 두 가지 토크나이저 모두에서 평균 성공률을 개선하는 것으로 나타났습니다. 특히 SimplerEnv의 경우, 혼합 데이터셋 훈련 조건 하에 DSD-BIN은 BIN 대비 전체 성공률에서 10.3 퍼센트 포인트 향상을 보였습니다. 또한 실제 로봇 실험에서도 로보틱스 사전 학습 유무와 관계없이 성능 향상이 확인되었습니다.

용어 풀이

VLA
시각·언어·행동(Vision-Language-Action) 모델. 보고 지시를 이해해 로봇의 동작까지 만들어 내요.
토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
토크나이저
글을 모델이 처리할 토큰으로 잘라 주는 도구.
원문arXiv · Direction-Scale Decomposition in Action Representation: Rethinking What to Tokenize for Vision-Language-Action Models같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv