AI 에이전트 연구

행동 모델용 VAE 양자화, 잠재 공간 계약 보존 기술 개발

LatentQuant: Preserving the Policy-Facing Latent Contract under NVFP4 VAE Quantization

ARarXiv10월 6일 발표 · 3분 · 프리프린트

세계 행동 모델(WAM)에서 비디오 VAE를 양자화할 때, 단순히 이미지 재구성을 넘어 다운스트림 정책이 요구하는 잠재 공간 정보(latent contract) 보존이 핵심 과제입니다.

왜 중요해요AI 정리

행동 모델을 구동하는 VAE를 양자화하여 속도를 높이면서도, 로봇 제어에 필수적인 잠재 공간의 정보를 정확하게 보존할 수 있게 되었어요.

세 줄 요약arXiv 원문 기반
  1. 연구진은 이 문제를 해결하기 위해 LatentQuant라는 2단계 QAT 프레임워크를 제안했습니다. 이는 양자화된 인코더는 고정하고 디코더만 적응시켜 성능 저하를 극복합니다.
  2. LatentQuant는 까다로운 행동 모델 벤치마크에서 높은 성공률을 유지하며 안정적인 제어력을 입증했습니다. 또한 NVIDIA B300 GPU 환경에서 VAE 구동 속도 향상 효과도 확인되었습니다.
  3. 기존 방식의 활성화 과정 오류로 인한 '잠재 드리프트'를 방지하기 위해, 정책에 특화된 양자화 접근법이 로봇 및 행동 모델 구현에 필수적입니다.

세계 행동 모델(WAM)은 사전 학습된 비디오 VAE의 인코더 잠재 벡터를 다운스트림 액션 정책에 직접 활용합니다. 따라서 과정에서는 단순히 재구성 충실도뿐만 아니라, 고정된 정책이 기대하는 '정책 지향적 잠재 계약'을 보존하는 것이 핵심 과제입니다. 기존 방식에서 NVFP4는 W4A4 양자화 오류를 충분히 보상하지 못하며, 공동 양자화 인식 훈련(QAT)은 이 표현을 복구할 수 있습니다.

연구진은 활성화 과정의 양자화-역양자화 연산이 재구성 신호와 디코더 자코비안을 변경하여 인코더로 돌아가는 기울기를 왜곡하고 지속적인 잠재 드리프트를 유발하는 문제를 발견했습니다. 이를 해결하기 위해 LatentQuant라는 2단계 NVFP4 QAT 프레임워크를 제안했습니다. 이 방법은 먼저 양자화된 인코더를 고정밀 버전과 정렬한 후, 디코더만 적응시키는 방식으로 작동합니다.

LatentQuant는 Wan2.1 및 Wan2.2 에서 기준선에 가까운 제어력과 높은 재구성 품질을 유지하며, LIBERO에서 95.75%, RoboTwin에서 68.8%의 성공률을 달성했습니다. 또한 NVIDIA B300 환경에서는 NVFP4 실행이 BF16 cuDNN 대비 엔드투엔드 VAE 속도를 1.17배~1.26배 향상시키는 효과도 확인되었습니다.

용어 풀이

양자화
모델 숫자의 정밀도를 낮춰 크기와 메모리 사용을 줄이는 기법. 품질이 조금 떨어질 수 있어요.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
GPU
많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
궁금한 점AI 정리 · 원문 기반
행동 모델에서 VAE를 양자화할 때 어떤 문제가 발생하나요?

기존 방식에서는 활성화 과정의 오류로 인해 '잠재 드리프트'가 발생했어요. 단순히 이미지 재구성만 하는 것이 아니라, 고정된 정책이 기대하는 '정책 지향적 잠재 계약'을 보존하는 것이 핵심 과제였기 때문이에요.

연구진이 제안한 LatentQuant 프레임워크는 어떻게 작동하나요?

LatentQuant는 2단계 QAT(공동 양자화 인식 훈련) 프레임워크예요. 이 방법은 먼저 양자화된 인코더를 고정밀 버전과 정렬하고, 디코더만 적응시키는 방식으로 작동하여 성능 저하를 극복해요.

LatentQuant를 사용했을 때 어떤 이점이 있나요?

Wan2.1 및 Wan2.2 같은 행동 모델 벤치마크에서 높은 성공률을 유지했어요. 또한, NVIDIA B300 GPU 환경에서는 기존 방식 대비 엔드투엔드 VAE 속도를 향상시키는 효과도 확인되었어요.

원문arXiv · LatentQuant: Preserving the Policy-Facing Latent Contract under NVFP4 VAE Quantization
궁금한 점 3개AI 정리