Die Realtime API von OpenAI liefert Ihnen einen Sprachagenten, aber Sie mieten ihn und Ihre Audiodaten verlassen das Gebäude. Hugging Face hat gerade die Open-Source-Antwort veröffentlicht: speech-to-speech, ein Framework, das VAD (Silero v5) → STT → LLM → TTS zu einer parallelen Pipeline verknüpft und eine WebSocket-API bereitstellt, die drop-in-kompatibel mit OpenAI Realtime ist. Richten Sie Ihren bestehenden Client auf localhost aus und er funktioniert. 8,2 k GitHub-Stars, +827 heute — das am schnellsten wachsende Voice-Repo derzeit.
Jeder Teil kann ausgetauscht werden
Nichts ist fest verankert. STT läuft mit Parakeet TDT, Whisper oder Paraformer. TTS läuft mit Qwen3-TTS, Kokoro oder Pocket TTS. Das LLM lässt sich an vLLM, llama.cpp oder OpenRouter anbinden, wenn Sie ein gehostetes Gehirn wollen. Mic, TCP oder benutzerdefinierter WebSocket für den Input. Kombinieren Sie nach Bedarf, bis Latenz und Sprachqualität dort sind, wo Sie sie benötigen.
Warum das wichtig ist
Dies ist kein Demo. Es betreibt bereits das Konversations-Backend für tausende Reachy Mini-Roboter im Einsatz. Für alle, die Sprachagenten bauen und Kundenaudio nicht an Dritte senden können — Gesundheitswesen, Hardware, On-Device — ist dies ein echter Weg: die Realtime-API-Form, vollständig lokal, keine Minuten-Abrechnung.