개발도구 연구

Taming Visual Neglect: A Variational Information Bottleneck Framework for Adaptive Attention in Multimodal In-Context Learning

ARarXiv8월 26일 발표 · 1분 · 심사 전 논문

멀티모달 인컨텍스트 학습(ICL)에서 시각 컨텍스트가 어떻게 작용하는지 정보 이론적 관점에서 분석한 VIB-ICL 프레임워크를 제안했다.

세 줄 요약arXiv 원문 기반
  1. 시각 컨텍스트의 추가 정보를 정량화한 크로스 모달 정보 이득(CMIG)을 도입했으며, 다섯 가지 벤치마크에서 최대 4.7% 정확도 향상과 필요한 데모 감소율 35%를 기록했다.
  2. 시각 정보가 중복되지 않는 경우 멀티모달 ICL이 텍스트만 사용하는 것보다 성능이 우수함을 증명하고, 시각 컨텍스트 무시 현상을 최적 해법으로 설명한다.
  3. 멀티모달 ICL의 성능 향상은 시각 정보가 비중복적일 때 유효하며, VIB-ICL은 변분 경계(variational bounds)를 이용해 CMIG를 추정하고 주의력을 재할당한다.

멀티모달 인컨텍스트 학습(ICL)에서 시각 컨텍스트가 어떻게 작용하는지 정보 이론적 관점에서 분석한 VIB-ICL 프레임워크를 제안했다.

원문arXiv · Taming Visual Neglect: A Variational Information Bottleneck Framework for Adaptive Attention in Multimodal In-Context Learning같은 주제 가이드 · 바로 써 보기오류가 나면 터미널 출력째 묻기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기