얼굴 근육 신호로 음성 복원하는 'Myovox' 시스템 개발 — AI 생성 일러스트
리서치 연구

얼굴 근육 신호로 음성 복원하는 'Myovox' 시스템 개발

Myovox: Reading Speech from the Muscles of the Face

arXiv9월 17일 발표 · 3분 · 프리프린트

얼굴 근육의 움직임에서 기록한 신호(sEMG)만을 이용해 발성된 영어 텍스트를 복원하는 'Myovox' 시스템이 개발되었습니다.

세 줄 요약arXiv 원문 기반
  1. 여러 음성 모델을 결합하고 대규모 언어 모델로 재순위화하여, 해당 데이터셋 최고 수준인 18.53%의 단어 오류율(WER)을 달성했습니다.
  2. 이는 발성 기관에 어려움이 있는 사람들에게 고정밀의 비침습적 의사소통 방법을 제공할 수 있는 중요한 기술적 진보입니다.
  3. 다만, 연구진은 성능 한계가 언어 모델이 아닌 근본적인 sEMG 신호 자체에 있음을 밝혀 물리적 제약도 존재함을 시사했습니다.

Myovox는 얼굴 근육에서 기록된 31채널 표면 전극근전도(sEMG) 신호를 이용해 발성된 영어 텍스트를 디코딩하는 시스템입니다. 이 연구는 기존의 emg2speech General Corpus에서 보고되던 단어 오류율(WER)을 51.17%에서 18.53%로 낮추는 성과를 보여주었습니다. 초기 단계에서는 공개된 오픈-볼캐뷸러리 디코드 설정을 복구하여 40.63% WER / 39.02% PER의 기준 성능을 재현했습니다.

성능 개선을 위해 연구진은 여러 단계를 거쳤습니다. 첫째, 기존의 인과적(causal) 인코더를 WavLM-Large 레이어-9 특징에 대한 교차 모달 증류 학습을 통해 훈련된 양방향 Conformer로 대체하여 sEMG만으로 26.14% WER / 22.34% PER를 달성했습니다. 둘째, 두 가지 음향 모델을 결합하고 다중 스케일 n-best 리스트를 통합한 후, QLoRA로 된 7B 언어 모델()로 재순위화하여 해당 코퍼스에서 가장 좋은 결과인 18.53% WER에 도달했습니다.

연구진은 최종적으로 이 접근 방식의 성능 한계가 언어 모델이 아닌 근본적인 sEMG 음성 포논 오류율(~20.9%)에 있음을 밝혔습니다. 즉, 올바른 단어들이 음향 사후 확률(acoustic posteriors) 자체에 존재하지 않기 때문에, 어떤 재순위화 장치도 9.30%의 n-best 오라클 수준에 도달할 수 없다는 물리적 제약이 존재함을 시사했습니다.

용어 풀이

미세 조정
이미 학습된 모델을 특정 목적의 데이터로 조금 더 학습시키는 일.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
원문arXiv · Myovox: Reading Speech from the Muscles of the Face
원문 보기arXiv