오비스 임베딩: 범용 다중 모달리티 임베딩의 새로운 지평
Ovis-Embedding: Pushing the Frontiers of Universal Omni-Modal Embeddings
arXivOvis-Embedding은 텍스트, 이미지, 비디오, 오디오 등 모든 종류의 모달리티를 하나의 공통 공간에 임베딩하는 최신 범용 모델입니다.
- 별도의 구조 대신 공유 백본을 사용하고 데이터 중심 학습 및 저랭크 분해 기법을 적용하여 성능과 효율성을 극대화했습니다.
- 모달리티 간 경계를 허물어 모든 종류의 데이터가 상호 검색(Any-to-Any Retrieval)되는 혁신적인 AI 활용 시대를 열었습니다.
- MMEB-v3 등 주요 다중 모달 벤치마크에서 최고 성능을 입증하며 범용 임베딩 모델의 새로운 기준을 제시했습니다.
Ovis-은 텍스트, 이미지, 비디오, 오디오 등 모든 종류의 모달리티를 하나의 공통 표현 공간에 인코딩하는 최신 범용 임베딩 모델입니다. 이 모델은 개별적인 모달리티 타워를 구성하는 대신 공유된 다중 모달 백본을 사용하여 다양한 모달리티를 통합적으로 처리합니다.
Ovis-Embedding은 세 가지 주요 발전을 통해 성능과 효율성을 높였습니다. 첫째, 사전 학습된 Qwen-omni 모델을 기반으로 대조 학습을 적용하여 네이티브 범용 모달 초기화를 수행했습니다. 둘째, 텍스트, 이미지, 비디오, 오디오를 아우르는 광범위하고 고품질의 코퍼스를 구축했으며, 동종 소스 샘플링 기법을 도입해 데이터 효율성을 개선했습니다. 마지막으로 포컬 로스와 유사도 기반 임베딩 증류(Embedding )를 통해 학습 및 추론 최적화를 진행합니다.
실험 결과에 따르면 Ovis-Embedding 계열은 MMEB-v3, MMEB-v2, MVEB, MAEB, RTEB 등 주요 에서 최고 성능을 달성했습니다. 이는 텍스트, 이미지, 비디오, 오디오 모달리티 전반에 걸쳐 효과적임을 입증하며, 통합된 범용 학습이 모달리티 파편화를 극복하고 모든 종류의 데이터가 상호 검색(any-to-any retrieval)될 수 있는 가능성을 보여줍니다.
용어 풀이
- Embedding
- 글이나 이미지의 의미를 숫자 목록으로 바꾼 것. 의미가 비슷한 것을 찾을 때 써요.
- Distillation
- 큰 모델의 답을 작은 모델이 따라 배우게 해서 가볍고 빠른 모델을 만드는 방법.
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.