실시간 음성 모델의 도구 호출을 위한 전후방 아키텍처 제안
A frontend-backend architecture for tool calls in full-duplex speech models
arXiv실시간 양방향 음성 모델에 외부 도구 사용 기능을 통합하기 위해, 프론트엔드와 백엔드를 분리한 전후방 아키텍처를 제안했습니다.
- 프론트엔드는 대화 흐름을 유지하며 요청을 전달하고, 백엔드 LLM이 실제 도구 호출 및 처리를 담당하여 낮은 지연 시간을 확보합니다.
- 본 방식은 최소한의 모델 수정만으로 자연스러운 대화 맥락과 강력한 에이전트 기능을 결합하는 모듈식 구조를 제시했다는 점에서 의미가 큽니다.
- 주요 벤치마크에서 기존 최고 수준의 모델들을 능가하는 성능을 입증했으며, 실시간 음성 상호작용 기반 AI 에이전트 개발에 효과적인 기준점을 제공합니다.
Full-duplex 음성-음성(S2S) 모델이 외부 도구 사용 기능을 갖추는 것이 자연스럽고 낮은 지연 시간의 대화형 상호작용에 필수적입니다. 이에 연구진은 프론트엔드와 백엔드를 분리한 전후방 아키텍처를 제안했습니다. 이 구조에서 duplex speech-to-text 프론트엔드는 '위임 (delegation token)'을 방출하고 스트리밍 ASR 스크립트를 텍스트 기반의 백엔드 으로 전달하여 도구 호출 처리를 위임합니다.
백엔드 LLM이 처리한 도구 호출 결과는 경량의 prefill-and-repeat 메커니즘을 통해 프론트엔드로 다시 주입되며, 이후 스트리밍 TTS를 거쳐 사용자에게 합성됩니다. 이 접근 방식은 최소한의 수정만으로 기존의 양방향 턴테이킹, 인터럽트 처리 및 낮은 지연 시간 상호작용 특성을 유지할 수 있습니다. 또한, 백엔드 위임 방식을 통해 자연스러운 음성 대화와 강력한 도구 호출 능력을 결합하는 모듈식 구조를 제시합니다.
단일 턴 도구 호출 평가에서 이 시스템은 92-97%의 높은 도구 호출 재현율을 달성했으며, 관련 없는 호출 거부 정확도는 81.2%에 달했습니다. 특히 백엔드로 Qwen3-235B-A22B와 같은 대형 모델을 사용할 경우, Full-Duplex-Bench-V3에서 오픈 및 클로즈드 소스 모델과 경쟁할 만한 결과를 보여주었으며, GPT-realtime-mini나 Qwen3-Omni-30B-A3B보다 성능이 우수함을 입증했습니다.
용어 풀이
- 토큰
- AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
- LLM
- 방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
- 에이전트
- 목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.