얼굴 근육 신호로 음성 복원하는 'Myovox' 시스템 개발
Myovox: Reading Speech from the Muscles of the Face
arXiv얼굴 근육의 움직임에서 기록한 신호(sEMG)만을 이용해 발성된 영어 텍스트를 복원하는 'Myovox' 시스템이 개발되었습니다.
- 여러 음성 모델을 결합하고 대규모 언어 모델로 재순위화하여, 해당 데이터셋 최고 수준인 18.53%의 단어 오류율(WER)을 달성했습니다.
- 이는 발성 기관에 어려움이 있는 사람들에게 고정밀의 비침습적 의사소통 방법을 제공할 수 있는 중요한 기술적 진보입니다.
- 다만, 연구진은 성능 한계가 언어 모델이 아닌 근본적인 sEMG 신호 자체에 있음을 밝혀 물리적 제약도 존재함을 시사했습니다.
Myovox는 얼굴 근육에서 기록된 31채널 표면 전극근전도(sEMG) 신호를 이용해 발성된 영어 텍스트를 디코딩하는 시스템입니다. 이 연구는 기존의 emg2speech General Corpus에서 보고되던 단어 오류율(WER)을 51.17%에서 18.53%로 낮추는 성과를 보여주었습니다. 초기 단계에서는 공개된 오픈-볼캐뷸러리 디코드 설정을 복구하여 40.63% WER / 39.02% PER의 기준 성능을 재현했습니다.
성능 개선을 위해 연구진은 여러 단계를 거쳤습니다. 첫째, 기존의 인과적(causal) 인코더를 WavLM-Large 레이어-9 특징에 대한 교차 모달 증류 학습을 통해 훈련된 양방향 Conformer로 대체하여 sEMG만으로 26.14% WER / 22.34% PER를 달성했습니다. 둘째, 두 가지 음향 모델을 결합하고 다중 스케일 n-best 리스트를 통합한 후, QLoRA로 된 7B 언어 모델()로 재순위화하여 해당 코퍼스에서 가장 좋은 결과인 18.53% WER에 도달했습니다.
연구진은 최종적으로 이 접근 방식의 성능 한계가 언어 모델이 아닌 근본적인 sEMG 음성 포논 오류율(~20.9%)에 있음을 밝혔습니다. 즉, 올바른 단어들이 음향 사후 확률(acoustic posteriors) 자체에 존재하지 않기 때문에, 어떤 재순위화 장치도 9.30%의 n-best 오라클 수준에 도달할 수 없다는 물리적 제약이 존재함을 시사했습니다.
용어 풀이
- 미세 조정
- 이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.