활용 사례 연구
Clustering and Token Denoising for Faster and More Robust VLMs
ARarXiv
arXiv 논문이 학습 없이 시각 토큰을 줄이고 노이즈에 강한 VLM 방법 ClustRS를 제안했다.
세 줄 요약
- ScienceQA-IMG와 MM-VET에서 LLaVA 1.5 7b 토큰을 97% 줄여 16개까지 낮추고 attention·diversity 기반 방법보다 최대 20% 앞섰다.
- 시각 토큰 576개나 729개 처리 부담이 컸던 엣지 배포에서 학습 없이 노이즈에 강한 LLaVA를 적용한다.
- LLaVA 1.5 7b 결과는 극한 노이즈와 토큰 조건에서, LLaVA-OneVision 결과는 가벼운 노이즈 조건에서 보고됐다.
arXiv 논문이 학습 없이 시각 토큰을 줄이고 노이즈에 강한 VLM 방법 ClustRS를 제안했다.