트랜션의 화자 귀속 다국어 ASR 시스템 공개 — AI 생성 일러스트AI 일러스트
리서치 연구

트랜션의 화자 귀속 다국어 ASR 시스템 공개

Transsion's Speaker-Attributed Multilingual ASR System for the MLC-SLM 2026 Challenge

arXiv9월 21일 발표 · 2분 · 심사 전 논문

다국어 환경의 대화 음성을 분석하여 누가, 언제 말했는지 분리해주는 화자 귀속형 ASR 시스템이 공개되었습니다.

세 줄 요약arXiv 원문 기반
  1. DiariZen 기반의 화자 분리, Qwen3-Omni를 활용한 다국어 ASR, 외부 정렬 모델을 통합한 융합 프레임워크가 핵심 기술입니다.
  2. 복잡한 다국어 대화 속에서도 화자별 발언을 정밀하게 추적할 수 있어 실제 서비스 적용 가능성이 매우 높습니다.
  3. 공식 테스트에서 높은 성과(tcpMER 15.41%, 2위)를 보였지만, 실제 현장의 다양한 음향 조건에서의 성능 검증이 필요합니다.

본 논문은 다국어 대화 음성에서 누가, 언제 말했는지 분리하는 '화자 귀속형 전사(speaker-attributed transcription)' 시스템을 소개합니다. 이 기술은 MLC-SLM 2026 챌린지 Task 1에 제출된 트랜션 스피치 팀의 결과물로, 다국어 대화 음성 분석에 초점을 맞추고 있습니다.

제안된 프레임워크는 세 가지 구성 요소로 이루어진 계층적 구조를 가집니다. 첫째, DiariZen을 기반으로 하는 화자 분리 모듈은 로컬 활동 추정 및 글로벌 클러스터링을 통해 화자별 구간을 생성합니다. 둘째, Qwen3-Omni에 기반한 ASR 모듈이 다국어 전사본을 생성하며, 외부 CTC 기반 정렬 모델이 정확한 단어 및 문자 단위 타임스탬프를 제공합니다.

마지막으로, 융합 모듈은 화자 분리 결과와 시간 정보가 포함된 전사본을 결합하여 최종적인 화자 귀속형 STM 출력을 생성합니다. 공식 평가 세트에서 실험 결과는 제안된 프레임워크의 효과를 입증했으며, 제출 시스템은 tcpMER 15.41%를 달성하며 참가 팀 중 2위를 기록했습니다.

원문arXiv · Transsion's Speaker-Attributed Multilingual ASR System for the MLC-SLM 2026 Challenge같은 주제 가이드 · 바로 써 보기영어 논문, 초록부터 쉽게 읽기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv