개발도구 도구

Tencent/WeMM-Embedding

GIGitHub8월 28일 업데이트 · 1분

위챗 비전 팀이 텍스트, 이미지, 비디오, 시각 문서 등 다양한 모달리티를 하나의 공간에 통합하여 표현하는 범용 멀티모달 임베딩 모델 'WeMM-Embedding'을 공개했습니다.

세 줄 요약GitHub 원문 기반
  1. 해당 모델은 여러 유형의 데이터를 아우르는 통일된 표현 능력을 바탕으로 MMEB-v2 및 v3와 같은 주요 벤치마크에서 최고 수준의 성능을 기록하며 우수성을 입증했습니다.
  2. 복잡한 멀티모달 데이터 처리가 필요한 검색, 분류, 이해 시스템 등 고도화된 AI 서비스를 개발하는 데 강력하고 범용적인 기반 기술로 활용 가능합니다.
  3. 현재 오디오 입력은 지원하지 않으며, 최적의 추론 및 서비스 환경 구축을 위해서는 vLLM이나 SGLang 같은 전문 서빙 프레임워크 사용이 권장됩니다.

위챗 비전 팀이 텍스트, 이미지, 비디오, 시각 문서 등 다양한 모달리티를 하나의 공간에 통합하여 표현하는 범용 멀티모달 임베딩 모델 'WeMM-Embedding'을 공개했습니다.

원문GitHub · Tencent/WeMM-Embedding같은 주제 가이드 · 바로 써 보기오류가 나면 터미널 출력째 묻기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기