리서치 연구
Giga-Embeddings: Mixture-of-Experts Encoders for High-Throughput Text Embeddings
ARarXiv
Giga-Embeddings는 강력한 검색 품질과 효율적인 서비스 제공을 결합하도록 설계된 Mixture-of-Experts 기반의 텍스트 임베딩 모델군이다.
세 줄 요약
- 가장 큰 멤버는 희소한(sparse) 10B 파라미터 MoE 인코더이며, 토큰당 약 1.8B의 활성 파라미터를 사용한다. vLLM 벤치마크에서 초당 114.5k 토큰을 처리했다.
- 이 모델군은 밀집 3B 모델보다 처리량이 25% 높고, 외부 시스템 대비 1.56~2.65배 높은 처리량을 제공한다. 또한 480M 모델은 FRIDA를 능가하는 성능을 보여준다.
- 컴퓨팅 및 메모리 예산에 따라 밀집 3B 인코더와 증류된 480M 인코더를 선택할 수 있다. 연구진은 세 가지 모델의 체크포인트를 모두 공개했다.
Giga-Embeddings는 강력한 검색 품질과 효율적인 서비스 제공을 결합하도록 설계된 Mixture-of-Experts 기반의 텍스트 임베딩 모델군이다.