엔비디아 Nemotron 3 Diarization 모델 가이드 — AI 생성 일러스트AI 일러스트
개발도구 가이드

엔비디아 Nemotron 3 Diarization 모델 가이드

nvidia/Nemotron-3-Diarization

Hugging Face발표일 미상 · 2분

엔비디아가 공개한 'Nemotron 3 Diarization'은 오픈 가중치 화자 분리 모델로, 실제 오디오에서 누가 언제 발언했는지(화자 식별)를 정확하게 파악합니다.

세 줄 요약Hugging Face 원문 기반
  1. 최대 8명까지의 다중 화자를 지원하며, 도착 순서 캐시(AOSC)와 FIFO 큐를 활용하여 스트리밍 및 오프라인 환경 모두에 최적화되었습니다.
  2. 회의록 작성, 미디어 콘텐츠 분석 등 여러 사람이 참여하는 복잡한 음성 데이터에서 발언 구간과 화자를 높은 정확도로 분리할 수 있습니다.
  3. 최적의 성능을 위해서는 원하는 지연 시간(Latency)에 맞춰 캐시 크기나 큐 길이 같은 스트리밍 파라미터를 세밀하게 조정해야 합니다.

Nemotron 3 Diarization은 실제 오디오에서 '누가 언제 발언했는지'를 판별하는 오픈 화자 분리(Speaker Diarization) 모델입니다. 이 모델은 최대 8명의 화자를 지원하며, 스트리밍 및 오프라인 추론 환경 모두에 적용 가능합니다. 특히 Sortformer 방식을 따라 출력 채널을 각 화자의 첫 도착 순서대로 정렬하여 발화자를 정확하게 식별하는 것이 특징입니다.

스트리밍 추론의 경우, 모델은 Arrival-Order Speaker Cache (AOSC)와 FIFO 큐를 도입하여 이전 청크에서 얻은 화자 정보를 유지하고 시간 경과에 따른 화자 신원을 보존합니다. 이 구조 덕분에 지연 시간에 민감한 애플리케이션을 위해 최소 80ms의 낮은 입력 버퍼 지연 시간을 지원하며, 오프라인 스타일 구성에서는 30.4초의 입력 버퍼를 사용합니다.

사용자는 NeMo-Speech.cpp와 같은 경량 C++ 런타임을 통해 로컬에서 모델을 실행할 수 있으며, Python 환경에서도 라이브러리를 이용해 추론이 가능합니다. 스트리밍 설정을 할 때는 원하는 지연 시간(Latency)에 맞춰 SPKCACHE_LEN, FIFO_LEN, CHUNK_LEN 등 여러 를 조정해야 최적의 성능을 얻을 수 있습니다.

용어 풀이

가중치
학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
파라미터
모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.
원문Hugging Face · nvidia/Nemotron-3-Diarization같은 주제 가이드 · 바로 써 보기오류가 나면 터미널 출력째 묻기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기