음성 대규모 언어 모델(SpeechLLMs)의 정확도 향상 기법
PTC-Bias: Phoneme-Level Temporal Competition for Bias Retrieval and Post-Decoding Correction in Speech LLMs
arXiv음성 대규모 언어 모델(SpeechLLMs)의 희귀 단어 인식 정확도를 높이기 위해, 음소 수준 시간 경쟁을 활용하는 'PTC-Bias'라는 2단계 프레임워크가 제안되었습니다.
- 이 방식은 사전 처리 단계에서 후보 음소를 압축하고, 디코딩 후 오답을 수정하는 2차 경쟁 과정을 거쳐 근접 동음 및 단어 분할 오류를 효과적으로 줄입니다.
- 대규모 편향 목록을 효율적으로 활용하면서도 추가적인 모델 연산 없이 높은 정확도를 유지하여 실용성이 매우 높다는 것이 핵심 강점입니다.
- 실험 결과, PTC-Bias는 기존 방식 대비 B-WER(단어 오류율)를 크게 낮추면서도 안정적인 성능 향상을 입증했습니다.
음성 (SpeechLLMs)에서 희귀 단어를 인식하는 성능을 높이기 위해, 음소 수준 시간 경쟁을 활용한 'PTC-Bias'라는 2단계 프레임워크가 제안되었습니다. 이 방식은 기존에 효율적으로 활용하기 어려웠던 대규모 편향 목록의 문제를 해결하며, 전반적인 문맥적 편향(Contextual biasing) 인식 능력을 개선하는 것을 목표로 합니다.
PTC-Bias는 두 단계로 작동합니다. 첫 번째 사전 처리(prefill) 단계에서 PTC Retrieval은 프레임 동기식 음소 디코딩과 후보 발음 간의 시간 경쟁을 수행하여, 압축된 편향 단어 목록과 해당 음성 구간을 생성합니다. 이후 SpeechLLM 디코딩이 완료되면, PTC Correction 단계가 두 번째 국지적 경쟁을 진행하며 검색된 후보와 불일치하는 전사 스팬(transcript spans) 간의 오류를 수정합니다.
이러한 2단계 과정은 근접 동음이나 단어 분할 오류를 줄이는 데 효과적이면서도 정확한 전사를 유지합니다. 특히, 두 단계 모두 동일한 음소 사후 확률을 공유하며 추가적인 SpeechLLM 순방향 패스(forward pass)가 필요 없어 효율적입니다. LibriSpeech 실험 결과에 따르면, PTC-Bias는 -SLAM-ASR-7B와 2000개의 편향 단어를 사용했을 때, test-clean/test-other 환경에서 B-WER을 기존 CTC-Filter 대비 각각 23.4%/23.9% 감소시키는 성능을 보였습니다.
용어 풀이
- 대규모 언어 모델
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- Prompt
- AI에게 주는 지시나 질문 글.