리서치 연구
LLM 기반 ASR에서 실시간 화자 음성 제외 기술 개발
Inference-Time Target Speaker Unlearning in LLM-Based Automatic Speech Recognition
arXiv다자간 음성 인식(ASR) 시스템에서 특정 화자가 원할 경우 자신의 발언을 자동으로 기록에서 제외하는 '타겟 스피커 언러닝' 기술이 개발되었습니다.
세 줄 요약
- 새로운 'Enrollment-Conditioned Gating(ECG)' 모듈을 활용하여, 학습 시 보지 못한 새로운 화자에게도 실시간으로 음성 제외 기능을 적용할 수 있는 것이 핵심입니다.
- 이는 현대 화상 회의 플랫폼에 실질적인 해결책을 제시하며, 참가자들이 강제 퇴장 없이 개인정보 보호가 가능한 환경을 구축하도록 돕습니다.
- 실험 결과, 제외된 화자의 인식 정확도는 감소하지만, 다른 참여자들의 기록 오류율은 안정적으로 유지되는 것으로 확인되었습니다.
연구진은 다자간 음성 인식(ASR) 및 화자 분리(diarization)를 위한 '타겟 스피커 언러닝 ASR (TSU-ASR)' 태스크를 제안했다. 이 태스크는 여러 화자가 참여하는 발화에서, 제외를 원하는 특정 화자의 음성은 기록하지 않으면서도 해당 화자가 활동하고 있음을 시스템이 표시해야 하는 것을 목표로 한다.
이를 위해 고정된(frozen) 이중 스트림 음성 에 'Enrollment-Conditioned Gating (ECG)'이라는 새로운 경량 모듈을 부착했다. 이 ECG 모듈은 초기 학습 단계에서 보지 못한 새로운 제외 화자에게도 추론 과정 중 동적으로 ASR 기능을 적용할 수 있게 하는 것이 핵심이다.
AMI(영어) 및 AliMeeting(만다린) 데이터셋 실험 결과, 제외된 화자의 음성 인식 정확도는 각각 72.3%에서 48.2%, 73.6%에서 27.3%로 감소했다. 그러나 기록을 유지하는 다른 참여자들의 전사 오류율은 거의 동일하게 유지되는 것으로 확인되었다. 이 접근 방식은 참가자들이 회의를 강제 퇴장하지 않고도 개인정보 보호가 가능한 환경을 제공하여 현대 화상 회의 플랫폼에 실질적인 해결책이 된다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.