Transcribe.cpp führt über 60 Sprachmodelle in einer Laufzeit aus — das llama.cpp der Stimme, unterstützt von Mozilla.ai

19. Juli 2026, 12:05

Lokale Sprache-zu-Text ist fragmentiert. whisper.cpp führt nur Whisper aus; Parakeet, Canary, Voxtral und Kyutai leben jeweils in eigenen Repos mit eigenen Eigenheiten. Transcribe.cpp fasst all das zu einer einzigen C/C++-Inference-Bibliothek zusammen: 16+ ASR-Modellfamilien, 60+ Modelle, alle im GGUF-Format, alle auf dem ggml-Runtime. Hacker News verlieh ihm 526 Punkte.

Das llama.cpp-Playbook, angewendet auf Sprache

CJ Pais — Autor von Handy, der Offline-Diktier-App — hat dies als erstes unabhängiges Projekt aus dem Builders-in-Residence-Programm von Mozilla.ai gebaut, nachdem er whisperfile und LocalScore für llamafile veröffentlicht hatte. Die Strenge zeigt sich: jedes Modell ist numerisch verifiziert und WER-getestet gegen seine Referenzimplementierung, nicht nur portiert und gehofft.

Eine Bibliothek, die Sie einbetten können

Es ist eine MIT-lizenzierte C/C++-Bibliothek plus CLI, beschleunigt durch Metal, Vulkan, CUDA und TinyBLAS. Betten Sie sie ein und Ihre App erhält vollständige Offline-Transkription — Diktat, Sitzungs-Notizen, Sprach-Agenten — mit der Freiheit, Whisper gegen ein schnelleres Parakeet auszutauschen (das 110M-Modell schlägt whisper base.en in der Geschwindigkeit), ohne Ihre Integration zu ändern. llamafile liefert sie bereits als transcribefile.

Eine Runtime, jedes Modell, läuft überall: Diese Wette hat das llama.cpp-Ökosystem aufgebaut. Spracherkennung hat gerade ihre Version erhalten.