누가 언제 말했는지 추적하는 화자 분리 기술: Nemotron 3
**Know Who Spoke When: Build Real-Time, Multi-Speaker AI with NVIDIA Nemotron 3 Diarization**
Hugging Face Blog엔비디아의 Nemotron 3 Diarization은 단순 음성 인식(ASR)을 넘어, 대화 속에서 누가 언제 발언했는지를 정확히 추적하는 화자 분리(Diarization) 기술입니다.
- 이 오픈 가중치 모델은 최대 8명의 화자와 동시 발화를 지원하며, VoiceArena 벤치마크에서 낮은 DER(14.72%)로 최고 성능을 기록했습니다.
- 자동 음성 인식과 결합하면 누가 어떤 말을 했는지 연결되어, 회의록 작성이나 액션 아이템 추출 같은 대화 분석 활용도가 극대화됩니다.
- 다만, 모델 성능은 배경 소음이나 잔향 등 환경적 조건에 영향을 받을 수 있으며, 제시된 처리 속도는 배치(batch) 기준임을 유의해야 합니다.
모든 대화는 '무엇이 말해졌는지'와 '누가 말했는지'라는 두 가지 정보를 담고 있습니다. 일반적인 음성 인식(ASR)은 발화된 단어를 전사하지만, 화자 분리(Speaker Diarization) 기술은 누가 언제 발언했는지 분류합니다. 회의록 작성이나 액션 아이템 추출 같은 대화 분석을 위해서는 단순히 텍스트를 아는 것을 넘어, 어떤 참여자가 특정 의견을 제시하거나 반론을 제기했는지 식별하는 것이 중요하기 때문입니다.
NVIDIA Nemotron 3 Diarization은 오픈 () 기반의 100M 모델로, 최대 8명의 화자를 지원하며 실시간 및 녹음된 대화에서 발생하는 중첩 발화까지 처리할 수 있습니다. 이 모델은 VoiceArena의 Diarization-Bench 리더보드에서 14.72%의 Diarization Error Rate (DER)를 기록하며 최고 성능을 입증했습니다. Nemotron 3는 이전 버전 대비 화자 지원 개수를 확장하고 정확도와 처리량(throughput)을 개선한 것이 특징입니다.
화자 분리 시스템은 발화를 감지하고 이를 올바른 화자에게 할당하는 문제를 해결해야 하며, 특히 침묵이나 중단 등 간격이 있는 상황에서도 이 할당을 유지하는 것이 중요합니다. Nemotron 3는 Arrival-Order Speaker Cache (AOSC)와 First-in, First-out (FIFO) 큐 같은 메모리 메커니즘을 활용하여 스트리밍 추론(streaming inference) 환경에서 안정적으로 작동합니다. 성능 평가는 누락된 발화(Missed speech), 오탐지(False alarm), 화자 혼동(Speaker confusion) 세 가지 오류를 결합한 DER로 측정됩니다.
이 모델은 독립적인 화자 활동 및 타임스탬프만 제공하므로, 실제 활용을 위해서는 ASR의 텍스트 출력과 결합하는 엔드투엔드 파이프라인 구축이 필요합니다. 이러한 통합 시스템은 발화된 단어를 특정 화자와 매핑하여 누가 어떤 말을 했는지 추적할 수 있게 합니다. 또한, Nemotron 3는 배치(batch) 처리 시 높은 효율성을 보여, 예를 들어 30.4초 설정에서 이전 기준 모델 대비 15,113×의 실시간 처리 속도 향상(RTFx)을 달성하며 정확성과 처리량을 동시에 확보했습니다.
용어 풀이
- 가중치
- 학습으로 정해진 모델 내부의 숫자 값. 내려받는 모델 파일의 본체예요.
- open-weight
- 학습된 가중치를 공개해 누구나 내려받아 쓸 수 있게 한 모델. 학습 데이터까지 공개한다는 뜻은 아니에요.
- 파라미터
- 모델이 학습하면서 조정한 내부 숫자. 개수가 많을수록 대체로 모델이 크고 무거워요.