질문 독립적인 가변 속도 시각 토큰 코딩 기술
Query Independent Variable Rate Visual Token Coding
arXiv기존 비전-언어 모델의 압축 방식은 질문에 따라 중요한 토큰을 선택하는 데 의존했지만, 이 연구는 모든 토큰을 유지하고 각 토큰별로 최적화된 압축률을 다르게 적용합니다.
이 기술은 질문에 의존하지 않고 모든 토큰을 압축하여, 데이터가 여러 번 재사용되는 환경에서도 성능 저하 없이 안정적으로 활용할 수 있게 해요.
- 이 기술의 핵심은 특정 질문(Query)에 의존하지 않고 단일한 압축 표현만으로 다양한 질의에 대응할 수 있다는 점이며, 이는 모델 출력 분포를 더 정확하게 보존합니다.
- 대화형 AI나 서버 간 데이터 전송처럼 정보가 여러 번 재사용되는 환경에서 성능 저하 없이 안정적인 활용이 가능해져 효율성이 크게 높아질 전망입니다.
- 제안된 방식은 모든 토큰을 유지하고 정밀한 비트 예산 최적화를 통해 압축률을 분배하며, 동일한 자원 조건에서 기존 방법보다 우수한 성능을 입증했습니다.
기존의 비전-언어 모델()을 위한 시각 압축 방식은 주로 어떤 토큰을 유지하고 나머지를 폐기할지 결정하는 '선택 문제'에 의존해왔습니다. 이러한 방법들은 언어 모델이 특정 토큰에 부여하는 주의력(attention)에 따라 순위를 매기므로, 질문 내용에 크게 좌우됩니다. 이 때문에 대화 과정에서 캐싱되거나 서버 간 전송처럼 압축된 표현이 여러 번 사용되는 환경에서는 성능 저하가 발생할 수 있습니다.
제안된 방식은 기존의 선택적 접근법 대신 모든 토큰을 유지하고 각 토큰별로 가변적인 압축률을 적용하는 방식을 채택했습니다. 이 기술은 변환 코드를 사용하여 각 토큰의 측정된 왜곡-속도 곡선을 노출시키고, 고정된 비트 예산을 해당 곡선들 위에서 정확한 정수 속도-왜곡 최적화(rate-distortion optimisation)를 통해 분배합니다.
이러한 접근 방식은 파이프라인에 텍스트가 들어가지 않기 때문에 단일 압축 표현만으로 어떤 질문에도 대응할 수 있다는 장점이 있습니다. 실험 결과, 이 방법은 동일한 비트 예산에서 모델의 출력 분포와 답변을 균일 속도 코딩이나 다른 최적화 기법보다 더 잘 보존하는 것으로 나타났습니다. 특히 이미지가 서로 다른 질문에 답해야 하는 상황에서는 기존 방식보다 우수한 성능을 입증했습니다.
용어 풀이
- VLM
- 이미지와 글을 함께 이해하는 모델.
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
기존의 시각 토큰 압축 방식은 어떤 문제점이 있었나요?
기존 방식은 언어 모델이 특정 토큰에 부여하는 주의력에 따라 중요한 토큰을 선택하고 나머지를 폐기했어요. 이 때문에 압축된 표현이 대화 과정에서 캐싱되거나 서버 간 전송처럼 여러 번 사용되는 환경에서는 성능 저하가 발생할 수 있었어요.
새로 제안된 기술은 어떻게 토큰을 압축하는 방식인가요?
이 방식은 기존의 선택적 접근법 대신 모든 토큰을 유지하고 각 토큰별로 가변적인 압축률을 적용해요. 변환 코드를 사용해 각 토큰의 왜곡-속도 곡선을 노출시키고, 고정된 비트 예산을 정수 속도-왜곡 최적화를 통해 분배합니다.
이 기술을 사용하면 어떤 이점이 있나요?
질문에 의존하지 않고 단일한 압축 표현만으로 다양한 질문에 대응할 수 있다는 장점이 있어요. 실험 결과, 동일한 비트 예산에서 모델의 출력 분포와 답변을 기존 방식보다 더 잘 보존하는 것으로 나타났어요.