Models
Nari Labs erreicht sub-50-ms-Latenz fuer Qwen3-TTS
Nari Labs hat eine stark optimierte Serving-Implementierung fuer das Text-to-Speech-Modell Qwen3-TTS 1.7B (CustomVoice) vorgestellt, die auf einer einzelnen NVIDIA H100 SXM eine p95 Time-to-First-Audio (TTFA) von unter 50 ms bei 10 Requests pro Sekunde erreicht. Damit liegt das System beim Preis bei rund 2 USD pro einer Million Zeichen — deutlich unter kommerziellen Angeboten wie ElevenLabs V3 (100 USD/Mio.) oder Cartesia Sonic 3.5 (49 USD/Mio.). Implementierung und Benchmark sind Open Source.
Wichtigste technische Eckdaten:
- Einheitlicher Scheduler fuer alle drei Modellkomponenten (Talker, Code Predictor, Codec) auf einer gemeinsamen Scheduling-Ebene statt getrennter Pipeline-Stufen; der Scheduler priorisiert nach Dringlichkeit und kann beliebige Pipeline-Stufen vorziehen.
- Streaming-orientierte Scheduling-Strategie: Anfragen vor dem ersten Audio-Chunk erhalten hoechste Prioritaet (TTFA-Kritisch), waehrend laufende Streams erst nahe ihrer Playback-Deadline urgent werden; dringende Anfragen dienen als Anker fuer Batching.
- CUDA-Graphs fuer den Code Predictor: Die regulaere 15-Schritt-Struktur pro Frame wird als einzelner CUDA-Graph mit vorallokiertem KV-Cache und spezialisiertem Triton-Attention-Kernel ausgefuehrt.
- State-Cached Codec: Inkrementelle Dekodierung mit zwischengespeichertem Transformer- und Konvolutionszustand statt voller Historien-Replay; erste Chunk noch voll dekodiert, danach inkrementell.
- Dynamische Chunk-Groessen: Kleine Anfangs-Chunks fuer schnelles TTFA, groessere Chunks fuer effizientes Sustained-Playback und besseres Batching.
- Leading-Silence-Trimming und frame-accumulation-Tuning reduzieren TTFA um rund 80 ms.
- Vergleich: vLLM-Omni, SGLang-Omni, VoxServe und M* wurden unter Poisson-Open-Loop-Last getestet; nur die Nari-Labs-Implementierung haelt sub-50-ms p95 TTFA bis 10 RPS und unter 100 ms bis 20 RPS.
Die Arbeit zeigt, dass die latenzkritische Koordination heterogener Modellkomponenten entscheidender ist als die isolierte Optimierung einzelner Module. Nari Labs plant, den Ansatz auf Bild-, Video- und Weltmodelle auszuweiten. Code und Benchmark sind auf GitHub verfuegbar.