LLM 기반 ASR에서 실시간 화자 음성 제외 기술 개발 — AI 생성 일러스트AI 일러스트
리서치 연구

LLM 기반 ASR에서 실시간 화자 음성 제외 기술 개발

Inference-Time Target Speaker Unlearning in LLM-Based Automatic Speech Recognition

arXiv9월 28일 발표 · 2분 · 심사 전 논문

다자간 음성 인식(ASR) 시스템에서 특정 화자가 원할 경우 자신의 발언을 자동으로 기록에서 제외하는 '타겟 스피커 언러닝' 기술이 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. 새로운 'Enrollment-Conditioned Gating(ECG)' 모듈을 활용하여, 학습 시 보지 못한 새로운 화자에게도 실시간으로 음성 제외 기능을 적용할 수 있는 것이 핵심입니다.
  2. 이는 현대 화상 회의 플랫폼에 실질적인 해결책을 제시하며, 참가자들이 강제 퇴장 없이 개인정보 보호가 가능한 환경을 구축하도록 돕습니다.
  3. 실험 결과, 제외된 화자의 인식 정확도는 감소하지만, 다른 참여자들의 기록 오류율은 안정적으로 유지되는 것으로 확인되었습니다.

연구진은 다자간 음성 인식(ASR) 및 화자 분리(diarization)를 위한 '타겟 스피커 언러닝 ASR (TSU-ASR)' 태스크를 제안했다. 이 태스크는 여러 화자가 참여하는 발화에서, 제외를 원하는 특정 화자의 음성은 기록하지 않으면서도 해당 화자가 활동하고 있음을 시스템이 표시해야 하는 것을 목표로 한다.

이를 위해 고정된(frozen) 이중 스트림 음성 에 'Enrollment-Conditioned Gating (ECG)'이라는 새로운 경량 모듈을 부착했다. 이 ECG 모듈은 초기 학습 단계에서 보지 못한 새로운 제외 화자에게도 추론 과정 중 동적으로 ASR 기능을 적용할 수 있게 하는 것이 핵심이다.

AMI(영어) 및 AliMeeting(만다린) 데이터셋 실험 결과, 제외된 화자의 음성 인식 정확도는 각각 72.3%에서 48.2%, 73.6%에서 27.3%로 감소했다. 그러나 기록을 유지하는 다른 참여자들의 전사 오류율은 거의 동일하게 유지되는 것으로 확인되었다. 이 접근 방식은 참가자들이 회의를 강제 퇴장하지 않고도 개인정보 보호가 가능한 환경을 제공하여 현대 화상 회의 플랫폼에 실질적인 해결책이 된다.

용어 풀이

LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · Inference-Time Target Speaker Unlearning in LLM-Based Automatic Speech Recognition같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv