리서치 연구
Successive Capacity Growth: Task-Complexity-Driven Width and Depth Expansion for Vision Transformer Encoders in JEPA World Models
ARarXiv
세계 모델링에 사용되는 비전 트랜스포머 인코더가 작업 난이도에 맞춰 용량을 늘리는 '점진적 용량 성장(SCG)' 기법을 제안했습니다.
세 줄 요약
- SCG는 최소 규모에서 시작해 필요에 따라 깊이나 너비를 점진적으로 확장하며, 복잡한 다중 객체 역학 등에서도 고정 모델 대비 높은 효율성을 입증했습니다.
- 이는 거대 AI 모델을 최대 용량으로 미리 구축할 필요 없이, 실제 작업 요구사항에 맞춰 자원을 효율적으로 확장하면서 최고 성능을 유지하는 것이 가능함을 의미합니다.
- 기능 보존 확장을 통해 아키텍처를 변경하므로 성능 저하 위험 없이 안전하게 용량을 늘릴 수 있으며 오탐지(false-positive)가 없습니다.
세계 모델링에 사용되는 비전 트랜스포머 인코더가 작업 난이도에 맞춰 용량을 늘리는 '점진적 용량 성장(SCG)' 기법을 제안했습니다.