개발도구 도구
Tencent/WeMM-Embedding
GIGitHub
위챗 비전 팀이 텍스트, 이미지, 비디오, 시각 문서 등 다양한 모달리티를 하나의 공간에 통합하여 표현하는 범용 멀티모달 임베딩 모델 'WeMM-Embedding'을 공개했습니다.
세 줄 요약
- 해당 모델은 여러 유형의 데이터를 아우르는 통일된 표현 능력을 바탕으로 MMEB-v2 및 v3와 같은 주요 벤치마크에서 최고 수준의 성능을 기록하며 우수성을 입증했습니다.
- 복잡한 멀티모달 데이터 처리가 필요한 검색, 분류, 이해 시스템 등 고도화된 AI 서비스를 개발하는 데 강력하고 범용적인 기반 기술로 활용 가능합니다.
- 현재 오디오 입력은 지원하지 않으며, 최적의 추론 및 서비스 환경 구축을 위해서는 vLLM이나 SGLang 같은 전문 서빙 프레임워크 사용이 권장됩니다.
위챗 비전 팀이 텍스트, 이미지, 비디오, 시각 문서 등 다양한 모달리티를 하나의 공간에 통합하여 표현하는 범용 멀티모달 임베딩 모델 'WeMM-Embedding'을 공개했습니다.