시각 음성 인식의 음소 재구성 오류 적응 연구
Curriculum-Based Noise Adaptation for Phoneme-to-Text Reconstruction in Visual Speech Recognition
arXiv시각 음성 인식에서 핵심적인 '음소-텍스트 재구성'의 신뢰도를 높이기 위해, 실제 환경 오류에 대비하는 PECT(점진적 오류 커리큘럼 훈련) 기법이 제안되었습니다.
- PECT는 합성 음소 교란 및 다중 도메인 라벨을 활용하여, 모델이 점진적으로 현실적인 예측 오류에 노출되도록 학습시켜 재구성 성능을 극대화합니다.
- V-ASR 등 다양한 음성 인식 시스템에 적용 가능하며, LRS2/LRS3 같은 주요 벤치마크에서 단어 오류율(WER) 감소를 입증했습니다.
- 제시된 결과는 특정 환경에서의 성능 향상을 보여주므로, 실제 다양한 음성 조건 및 노이즈 환경에 대한 추가 검증이 필요합니다.
음소 중심 시각 음성 인식(Phoneme-centric visual speech recognition)은 문장을 중간 단계의 음소 예측을 통해 재구성하는 방식이며, 이 과정에서 음소를 텍스트로 재구성하는 모델의 신뢰도가 전체 성능에 크게 좌우됩니다. 기존의 재구성 접근법들은 깨끗한 음소 시퀀스나 인위적으로 손상된 입력으로 학습되는 경우가 많아, 실제 추론 환경에서 발생하는 현실적인 오류와는 괴리가 발생한다는 한계가 지적되었습니다.
이러한 문제를 해결하기 위해 본 논문은 점진적 오류 커리큘럼 훈련(PECT)을 제안합니다. 이 커리큘럼 학습 프레임워크는 NLLB 기반의 음소-텍스트 재구성 모델에 합성 음소 교란, 다중 도메인 가짜 라벨, 그리고 시각 음성 인식기가 생성한 타겟 도메인 가짜 라벨을 활용하여 점진적으로 적응시킵니다. 이를 통해 모델은 현실적인 예측 오류에 노출되면서도 문장 재구성 정확도를 유지하며 강건성을 높일 수 있습니다.
실험 결과, PECT는 LRS2 및 LRS3 에서 다양한 음성 인식 프론트엔드(V-ASR, PV-ASR 등)에 걸쳐 성능 향상을 입증했습니다. 구체적으로 HP-VSR-FiLMFuse (L4)의 경우 LRS2에서 단어 오류율(WER)이 23.3%에서 22.2%로 감소했으며, HP-VSR-ResFiLM은 LRS3에서 WER이 30.3%에서 29.7%로 감소하는 결과를 보였습니다.
용어 풀이
- 벤치마크
- 모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.