잡음이 심한 경찰 음성 데이터에 ASR 모델 적용 연구
Pretrained ASR Pseudo-labeling for Noisy Police Audio
arXiv잡음이 심한 경찰 통신 녹취록(BPC) 환경에서 기존 ASR 시스템의 성능 저하 문제를 해결하기 위해, 값비싼 수동 라벨링 대신 가짜 라벨링 기법을 적용했습니다.
- 기존 내부 신뢰도 측정 방식으로는 노이즈 환경에서 라벨 품질 구분이 어려웠기에, 문맥적 타당성을 검증하는 외부 LLM 기반 필터링 방식을 도입하여 성능을 개선했습니다.
- 이 기술은 고비용의 수동 작업 없이도 전문 음성 데이터에 ASR 모델을 효과적으로 적응시켜, 경찰 결정 과정 분석 등 중요한 분야의 AI 발전에 기여할 수 있습니다.
- LLM 필터링으로 성능 향상을 입증했으며, 앞으로는 모델 간 상호 라벨링(Cross-model pseudo-labeling) 방식이 유망한 연구 방향으로 제시되었습니다.
기존의 사전 학습된 ASR 시스템은 잡음이 많은 방송 경찰 통신(BPC) 환경에서 성능 저하를 보이며, 이는 경찰 결정 과정 이해와 같은 분야의 분석을 어렵게 합니다. 본 연구는 값비싼 수동 라벨링 대신 가짜 라벨링(Pseudo-labeling) 기법을 활용하여 ASR 모델을 개선하는 것을 목표로 하였으나, 매우 잡음이 심한 도메인에서의 효과 검증은 미흡했습니다.
연구진은 기존의 내부 신뢰도 지표(로그 확률 및 STAR 점수)가 고품질과 저품질의 BPC 가짜 라벨을 구분하는 데 실패함을 확인했습니다. 이에 따라 문맥적 타당성을 활용하여 부적절한 전사본을 걸러내는 외부 기반 심판자(LLM-as-a-judge) 필터링 패러다임을 도입했습니다. 이 방식은 내부 지표보다 더 적극적으로 작동하며, Baltimore 및 Chicago BPC 코퍼스에서 가짜 라벨 세트의 WER을 크게 감소시키는 결과를 보였습니다.
이 연구는 LLM 심판자 필터링에도 불구하고 여전히 이상적인(oracle) 필터 대비 상당한 성능 격차가 존재함을 확인했습니다. 또한, 한 모델이 다른 모델의 가짜 라벨로 되는 새로운 교차 모델 가짜 라벨링 패러다임을 제시했으며, 이는 향후 가짜 라벨링 작업에 유망한 연구 방향으로 식별되었습니다.
용어 풀이
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.