Nari Labs stellt Qwen3-TTS mit einer ersten Audioausgabe von unter 50 ms und 2 $ pro Million Zeichen bereit.

22. August 2026, 06:08

ElevenLabs V3 kostet 100 $ pro Million Zeichen. Cartesia Sonic 3.5 kostet 49 $. Nari Labs hat gerade einen open‑sourced Inferenz‑Stack veröffentlicht, der dieselbe Aufgabe für etwa 2 $ erledigt – 25‑50 x günstiger und mit besserer Latenz. HN gab ihm an einem Tag 118 Punkte.

Kein neues Modell, nur brutale Inferenz‑Engineering

Dies ist eine Serving‑Implementierung von Qwen3-TTS 1.7B CustomVoice, Alibabas Open-Weights-Sprachmodell. Nari hat die Pipeline neu geschrieben: Ein Scheduler führt alle drei Komponenten (Talker, Code Predictor, Codec) als unabhängig planbare Aufgaben statt einer festen Reihenfolge aus, Anfragen, die noch auf ihr erstes Audio‑Chunk warten, erhalten Vorrang vor bereits gestreamten, plus CUDA‑Graphs und ein zustands-gecached-Codec. Auf einem einzelnen H100: 10 Anfragen pro Sekunde, 34 ms p95 Zeit-bis-erstes-Audio, 630 Zeichen pro Sekunde bei voller Auslastung.

Selbst hosten als eigene TTS‑API

Das gesamte System wird als Open‑Source mit Streaming‑ und Non‑Streaming‑HTTP‑Endpoints plus WebSocket‑Texteingabe ausgeliefert – deployen Sie ein H100 und Sie haben eine Voice‑API für Echtzeit‑Agenten, Dubbing oder Call‑Automation. Das Team hat zuvor Dia entwickelt, das Dialog‑TTS‑Modell mit über 2 M+ Downloads.

Open‑Weights plus Inferenz‑Engineering unterbieten jetzt kommerzielle Voice‑APIs um das 50‑fache. Dieses Preismodell überlebt das nicht.