실시간 음성 모델의 도구 호출을 위한 전후방 아키텍처 제안 — AI 생성 일러스트AI 일러스트
AI 에이전트 연구

실시간 음성 모델의 도구 호출을 위한 전후방 아키텍처 제안

A frontend-backend architecture for tool calls in full-duplex speech models

arXiv9월 18일 발표 · 3분 · 심사 전 논문

실시간 양방향 음성 모델에 외부 도구 사용 기능을 통합하기 위해, 프론트엔드와 백엔드를 분리한 전후방 아키텍처를 제안했습니다.

세 줄 요약arXiv 원문 기반
  1. 프론트엔드는 대화 흐름을 유지하며 요청을 전달하고, 백엔드 LLM이 실제 도구 호출 및 처리를 담당하여 낮은 지연 시간을 확보합니다.
  2. 본 방식은 최소한의 모델 수정만으로 자연스러운 대화 맥락과 강력한 에이전트 기능을 결합하는 모듈식 구조를 제시했다는 점에서 의미가 큽니다.
  3. 주요 벤치마크에서 기존 최고 수준의 모델들을 능가하는 성능을 입증했으며, 실시간 음성 상호작용 기반 AI 에이전트 개발에 효과적인 기준점을 제공합니다.

Full-duplex 음성-음성(S2S) 모델이 외부 도구 사용 기능을 갖추는 것이 자연스럽고 낮은 지연 시간의 대화형 상호작용에 필수적입니다. 이에 연구진은 프론트엔드와 백엔드를 분리한 전후방 아키텍처를 제안했습니다. 이 구조에서 duplex speech-to-text 프론트엔드는 '위임 (delegation token)'을 방출하고 스트리밍 ASR 스크립트를 텍스트 기반의 백엔드 으로 전달하여 도구 호출 처리를 위임합니다.

백엔드 LLM이 처리한 도구 호출 결과는 경량의 prefill-and-repeat 메커니즘을 통해 프론트엔드로 다시 주입되며, 이후 스트리밍 TTS를 거쳐 사용자에게 합성됩니다. 이 접근 방식은 최소한의 수정만으로 기존의 양방향 턴테이킹, 인터럽트 처리 및 낮은 지연 시간 상호작용 특성을 유지할 수 있습니다. 또한, 백엔드 위임 방식을 통해 자연스러운 음성 대화와 강력한 도구 호출 능력을 결합하는 모듈식 구조를 제시합니다.

단일 턴 도구 호출 평가에서 이 시스템은 92-97%의 높은 도구 호출 재현율을 달성했으며, 관련 없는 호출 거부 정확도는 81.2%에 달했습니다. 특히 백엔드로 Qwen3-235B-A22B와 같은 대형 모델을 사용할 경우, Full-Duplex-Bench-V3에서 오픈 및 클로즈드 소스 모델과 경쟁할 만한 결과를 보여주었으며, GPT-realtime-mini나 Qwen3-Omni-30B-A3B보다 성능이 우수함을 입증했습니다.

용어 풀이

토큰
AI 모델이 글을 처리하는 단위. 단어보다 작은 조각이며 사용량과 요금을 셀 때 기준이 돼요.
LLM
방대한 글을 학습해 문장을 이해하고 만들어 내는 AI 모델. ChatGPT, Claude, Gemini가 여기에 속해요.
에이전트
목표를 받으면 스스로 계획을 세우고 도구를 써서 여러 단계의 작업을 해내는 AI.
원문arXiv · A frontend-backend architecture for tool calls in full-duplex speech models같은 주제 가이드 · 바로 써 보기매일 아침 소식, 예약 작업으로 받기

평일 아침 메일로 받아 보기 ›틀린 곳 알리기

원문 보기arXiv