Gemma 4 기반 다중 모드 의사 결정 분류기 Jev-Omni 소개 — AI 생성 일러스트AI 일러스트
모델 도구

Gemma 4 기반 다중 모드 의사 결정 분류기 Jev-Omni 소개

akhilaaa3/Jev-Omni

Hugging Face발표일 미상 · 2분

Jev-Omni는 텍스트, 이미지, 오디오, 비디오 등 다양한 모달리티를 입력받아 질문에 대한 선택지별 확률 분포를 계산하는 다중 모드 의사 결정 분류기입니다.

세 줄 요약Hugging Face 원문 기반
  1. Gemma 4 12B IT 기반으로 개발되었으며, DecisionBench 등 여러 벤치마크에서 높은 정확도를 입증하며 강력한 성능을 보여주었습니다.
  2. 단순히 설명을 생성하는 것이 아니라 각 선택지에 대한 정량적 확률을 제공하므로, 구조화된 의사 결정이나 분류가 필요한 시스템에 최적화되어 있습니다.
  3. 최대 20개 이하의 옵션에서 최고의 성능을 기대할 수 있으며, 원활한 구동을 위해서는 CUDA GPU와 같은 고성능 하드웨어 환경이 필요합니다.

Jev-Omni는 Gemma 4 12B IT를 기반으로 구축된 다중 모드() 의사 결정 분류기입니다. 이 모델은 텍스트, 이미지, 오디오, 비디오 등 다양한 형태의 입력을 처리할 수 있으며, 사용자가 제시한 질문과 선택지 옵션에 대해 생성 설명 대신 각 옵션별 확률 분포를 제공하는 것이 특징입니다.

다양한 테스트에서 높은 성능을 보여주었습니다. DecisionBench Medium에서는 87.57%의 정확도를 기록했으며, JevBench에서도 86.15%의 정확도를 달성했습니다. 또한, 오디오 입력은 최대 30초까지, 비디오는 16프레임까지 처리할 수 있도록 설계되었습니다.

이 모델을 사용하기 위해서는 가 필요하며, 추론 시 BF16 autocast를 사용하는 것이 권장됩니다. 성능 면에서는 옵션 개수가 20개 이하일 때 가장 좋은 지원을 받을 수 있습니다. 개발자는 `pip install` 명령어를 통해 라이브러리를 설치하고 Python 코드를 이용해 예측(predict) 기능을 활용할 수 있습니다.

용어 풀이

multimodal
글뿐 아니라 이미지·음성·영상처럼 여러 형태의 입력을 함께 다루는 것.
벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
CUDA
엔비디아 GPU에서 계산 프로그램을 돌리게 해 주는 개발 플랫폼.
GPU
많은 계산을 한꺼번에 처리하는 칩. AI 학습과 실행에 가장 많이 써요.
원문Hugging Face · akhilaaa3/Jev-Omni같은 주제 가이드 · 바로 써 보기내 업무 예시로 AI 모델 비교하기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기