인프라 뉴스

How we made a text-to-speech model respond in sub-50 ms

HNHacker News8월 21일 발표 · 1분

Nari Labs는 Qwen3-TTS 1.7B CustomVoice 구현으로 단일 NVIDIA H100 SXM에서 10 RPS와 p95 TTFA 50ms 미만을 달성했다.

세 줄 요약Hacker News 원문 기반
  1. 앞부분 침묵을 자르고, Codec 프레임 축적을 조정하며, 세 모듈을 하나의 스케줄러로 묶어 10 RPS까지 p95 TTFA 50ms 미만을 유지했다.
  2. H100 SXM 1시간 $4.29 기준으로 완전 가동 시 1M자당 약 $2로, ElevenLabs V3 $100, Cartesia Sonic 3.5 $49보다 낮다.
  3. 비용 추정에는 네트워크, 유휴 용량, 운영 오버헤드가 제외됐고, SGLang-Omni 지원은 2026년 8월 중순에 불완전했다.

Nari Labs는 Qwen3-TTS 1.7B CustomVoice 구현으로 단일 NVIDIA H100 SXM에서 10 RPS와 p95 TTFA 50ms 미만을 달성했다.

원문Hacker News · How we made a text-to-speech model respond in sub-50 ms

평일 아침 메일로 받아 보기 ›틀린 곳 알리기