오비스 임베딩: 범용 다중 모달리티 임베딩의 새로운 지평 — AI 생성 일러스트AI 일러스트
리서치 연구

오비스 임베딩: 범용 다중 모달리티 임베딩의 새로운 지평

Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings

arXiv9월 23일 발표 · 2분 · 심사 전 논문

Ovis-Embedding은 텍스트, 이미지, 비디오, 오디오 등 모든 종류의 모달리티를 하나의 공통 공간에 임베딩하는 최신 범용 모델입니다.

세 줄 요약arXiv 원문 기반
  1. 별도의 구조 대신 공유 백본을 사용하고 데이터 중심 학습 및 저랭크 분해 기법을 적용하여 성능과 효율성을 극대화했습니다.
  2. 모달리티 간 경계를 허물어 모든 종류의 데이터가 상호 검색(Any-to-Any Retrieval)되는 혁신적인 AI 활용 시대를 열었습니다.
  3. MMEB-v3 등 주요 다중 모달 벤치마크에서 최고 성능을 입증하며 범용 임베딩 모델의 새로운 기준을 제시했습니다.

Ovis-은 텍스트, 이미지, 비디오, 오디오 등 모든 종류의 모달리티를 하나의 공통 표현 공간에 인코딩하는 최신 범용 임베딩 모델입니다. 이 모델은 개별적인 모달리티 타워를 구성하는 대신 공유된 다중 모달 백본을 사용하여 다양한 모달리티를 통합적으로 처리합니다.

Ovis-Embedding은 세 가지 주요 발전을 통해 성능과 효율성을 높였습니다. 첫째, 사전 학습된 Qwen-omni 모델을 기반으로 대조 학습을 적용하여 네이티브 범용 모달 초기화를 수행했습니다. 둘째, 텍스트, 이미지, 비디오, 오디오를 아우르는 광범위하고 고품질의 코퍼스를 구축했으며, 동종 소스 샘플링 기법을 도입해 데이터 효율성을 개선했습니다. 마지막으로 포컬 로스와 유사도 기반 임베딩 증류(Embedding )를 통해 학습 및 추론 최적화를 진행합니다.

실험 결과에 따르면 Ovis-Embedding 계열은 MMEB-v3, MMEB-v2, MVEB, MAEB, RTEB 등 주요 에서 최고 성능을 달성했습니다. 이는 텍스트, 이미지, 비디오, 오디오 모달리티 전반에 걸쳐 효과적임을 입증하며, 통합된 범용 학습이 모달리티 파편화를 극복하고 모든 종류의 데이터가 상호 검색(any-to-any retrieval)될 수 있는 가능성을 보여줍니다.

용어 풀이

Embedding
글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
Distillation
큰 모델의 답을 작은 모델이 따라 배우게 해서 가볍고 빠른 모델을 만드는 방법.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
원문arXiv · Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv