Microsoft VibeVoice erreicht 51 K GitHub‑Stars: Open-Source-TTS, das 90 Minuten lang spricht

29. Juli 2026, 18:10

Was VibeVoice eigentlich ist

Microsoft hat ein Langform‑, Mehrsprecher‑Text‑zu‑Sprache‑Modell Open‑Source gestellt — und es erreichte 51 000 Sterne. Das ist kein Demo‑Spielzeug. VibeVoice synthetisiert bis zu 90 Minuten durchgängiges Audio mit bis zu vier unterschiedlichen Sprechern in einem Durchlauf, in Englisch und Chinesisch. Der Trick ist ein kontinuierlicher Sprach‑Tokenizer, der mit 7,5 Hz Bildrate läuft: Er bewahrt hohe Treue, während er lange Sequenzen kostengünstig erzeugt. Die Basis ist Qwen2.5 1.5B.

ElevenLabs‑grade Natürlichkeit und Emotion, nur dass die Gewichte von Ihnen selbst gehostet werden können. Keine pro‑Token‑Cloud‑Abrechnung für jede Podcast‑Folge, jedes Hörbuch‑Kapitel oder jede Agenten‑Antwort.

Der API‑Ansatz

Ein neuer VibeVoice‑Realtime 0.5B (MIT‑Lizenz) streamt Text ein und gibt das erste Audio nach etwa 300 ms aus, mit einer WebSocket‑API für den Echtzeit‑Einsatz — Sprach‑Agenten, Live‑Erzählungen, Dialog‑Produkte. Selbst hosten, Streaming‑Text zufüttern und 24 kHz‑Sprache zurück erhalten.

Ein Hinweis: Microsoft hat den ursprünglichen TTS‑Code zurückgezogen, nachdem Missbrauch festgestellt wurde, sodass die meisten Nutzer jetzt Community‑Forks der Gewichte verwenden.