오디오 언어 모델, 듣기와 읽기를 같은 방식으로 처리하는가?
Do Audio Language Models Hear and Read Distinctive Features Alike?
arXiv오디오 언어 모델이 음성(듣기)과 텍스트(읽기)를 하나의 디코더로 처리할 때, 특정 음운 특징을 일관되게 인식하는지 분석했습니다.
- 연구 결과, 음운 특징의 표현 일관성은 모델 크기가 아닌 '모델 계열'에 의해 결정되는 경향이 나타났으며, 성대 울림(voicing) 같은 일부 특징에서 높은 일치도가 관찰되었습니다.
- 이는 오디오 언어 모델이 단순히 입력을 처리하는 것을 넘어, 음성 및 텍스트 전반에 걸쳐 추상적이고 공통된 언어 특징을 학습하고 있음을 시사합니다.
- 다만, 측정 결과의 신뢰도는 모델 간 편차가 크고(최대 7배), 분석에 필요한 최소한의 음운 쌍이 충분할 때만 유효하다는 점을 고려해야 합니다.
오디오 언어 모델은 음성(speech)과 텍스트를 단일 디코더로 처리합니다. 본 연구는 이 디코더가 특정 음운 특징을 인식할 때, 해당 음운이 '들리는' 경우와 '읽히는' 경우에 동일한 방향성을 나타내는지 분석했습니다. 이를 위해 하나의 특징만 다른 최소 음운 쌍(minimal pairs)을 활용하여 두 입력 스트림의 평균 표현 간 오프셋을 계산하고, 이 오프셋들의 코사인 유사도를 측정하는 방식으로 연구를 진행했습니다.
이 실험은 총 6개의 모델, 7가지 특징, 그리고 11개 계열에 속한 15개 언어에서 수행되었습니다. 분석 결과, 여러 가설 검정(multiple testing)을 거친 후, Qwen2.5-Omni 모델 두 개에서 성대 울림(voicing) 특징만이 기준치(reference)를 초과하는 것으로 나타났습니다. 다만, 이 비교 기준치는 모델마다 최대 7배까지 편차가 큰 것으로 측정되었습니다.
세 모델 중 세 개의 모델에서는 충분한 최소 음운 쌍을 가진 14개 언어에 걸쳐 성대 울림 특징이 오디오 스트림에서 일관된 방향성을 보였습니다. 모든 언어 쌍은 이 세 가지 방향성 중 두 가지에서 공통점을 나타냈습니다. 연구는 최종적으로 특정 특징의 표현 방식이 모델의 크기보다는 '모델 계열(model family)'에 의해 결정되는 경향을 보여주었습니다.