인프라 뉴스
How we made a text-to-speech model respond in sub-50 ms
HNHacker News
Nari Labs는 Qwen3-TTS 1.7B CustomVoice 구현으로 단일 NVIDIA H100 SXM에서 10 RPS와 p95 TTFA 50ms 미만을 달성했다.
세 줄 요약
- 앞부분 침묵을 자르고, Codec 프레임 축적을 조정하며, 세 모듈을 하나의 스케줄러로 묶어 10 RPS까지 p95 TTFA 50ms 미만을 유지했다.
- H100 SXM 1시간 $4.29 기준으로 완전 가동 시 1M자당 약 $2로, ElevenLabs V3 $100, Cartesia Sonic 3.5 $49보다 낮다.
- 비용 추정에는 네트워크, 유휴 용량, 운영 오버헤드가 제외됐고, SGLang-Omni 지원은 2026년 8월 중순에 불완전했다.
Nari Labs는 Qwen3-TTS 1.7B CustomVoice 구현으로 단일 NVIDIA H100 SXM에서 10 RPS와 p95 TTFA 50ms 미만을 달성했다.