사용자 생성 텍스트 발음 추론을 위한 새로운 G2P 벤치마크 — AI 생성 일러스트AI 일러스트
리서치 연구

사용자 생성 텍스트 발음 추론을 위한 새로운 G2P 벤치마크

Phonemizing User-Generated Text: A Benchmark, Taxonomy, and Compositional Approach

arXiv9월 24일 발표 · 3분 · 심사 전 논문

음성 합성 시스템은 소셜 미디어 등 사용자 생성 텍스트(UGT)의 발음을 정확히 추론해야 하는 과제에 직면했습니다. 연구진은 영어, 베트남어, 한국어를 아우르는 최초의 UGT 전용 G2P 벤치마크인 'UGTPhon'을 제시했습니다.

세 줄 요약arXiv 원문 기반
  1. 기존 모델들은 표준 형태와 실제 사용 형태 간 성능 격차가 크다는 문제를 발견하고, 이를 해결하기 위해 '표준 형태' 증거를 통합하는 조합적 G2P 접근법을 제안했습니다.
  2. 단순히 거대한 LLM에 의존하기보다, 텍스트의 표준 정보를 명시적으로 활용하는 것이 UGT 음성 변환 정확도를 높이는 데 효과적임을 입증하여 핵심적인 방법론을 제시했습니다.
  3. 제안된 방식은 작은 규모의 모델에서도 높은 성능을 보여주었으며, 이는 사용자 생성 텍스트 발음 추론에 명시적 규칙 기반 모델링이 중요함을 시사합니다.

음성 합성 시스템(TTS)은 소셜 미디어 등에서 발생하는 사용자 생성 텍스트(UGT)를 처리할 때, 표면적인 형태가 아닌 표준적인 형태(canonical form)로부터 발음을 추론해야 하는 과제에 직면합니다. 연구진은 이러한 UGT 환경을 위한 최초의 음소-음성 변환(G2P) 인 'UGTPhon'을 개발했습니다. 이 벤치마크는 영어, 베트남어, 한국어를 포함하며, 미세한 진단을 위한 추론 기반 분류 체계도 함께 제시합니다.

기존의 G2P 모델과 최신 들은 표준 형태와 실제 사용 형태 간에 최대 66.8 PER 포인트에 달하는 체계적인 성능 격차를 보이는 문제가 있었습니다. 이를 해결하기 위해 연구진은 '표준 형태' 증거를 통합하는 조합적(compositional) G2P 접근법을 제안했습니다. 이 방법론은 정확 일치 검색(exact-match lookup)과 단계별 디코딩을 결합하여 표준 형태의 정보를 명시적으로 활용합니다.

제안된 방식은 ByT5 및 Qwen2.5-0.5B 백본 모델에 적용되었으며, 명시적인 표준 형태 모델링이 비표준 G2P 오류를 줄이는 데 효과적임을 입증했습니다. 특히 0.5B 버전의 성능이 훨씬 큰 소수점() LLM과 경쟁할 수 있는 수준을 보여주면서, UGT 음성 변환 과정에서 명시적인 규칙 기반 모델링의 중요성을 강조합니다.

용어 풀이

벤치마크
모델 성능을 같은 조건에서 비교하려고 만든 시험 문제 모음.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
few-shot
몇 개의 예시를 함께 보여 주고 과제를 시키는 방식.
원문arXiv · Phonemizing User-Generated Text: A Benchmark, Taxonomy, and Compositional Approach같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기