Ternlight quetscht ein Satz-Embedding-Modell in 7 MB WASM — Browser-semantische Suche in 5 ms

7. Juli 2026, 06:09

Die meisten In-Browser-Embedding-Setups verlangen, dass du 30 MB herunterlädst: ein quantisiertes Modell, das ONNX‑Runtime, einen Tokenizer und zusätzlich das Transformers.js‑Glue. Ternlight liefert die Engine, Gewichte und den Tokenizer als einen 7 MB‑WASM‑Blob und führt das Ganze auf der CPU aus. Kein WebGPU, kein Server, kein API‑Key, keine Netzwerkaufrufe. Es landete mit 120 Punkten auf der HackerNews‑Frontpage.

Was es eigentlich ist

Ternlight ist ein Sentence-Embedding-Modell, keine App. Du erhältst zwei Funktionen: embed wandelt Text in einen Vektor um, similar rankt Kandidaten gegenüber einer Anfrage. Ihre Demo durchsucht die React‑Dokumentation live im Browser – etwa 5 ms pro Suche, jedes Byte bleibt on‑device. Diese Datenschutz‑Story ist das gesamte Verkaufsargument: nichts verlässt die Maschine.

Die API

npm install @ternlight/base für den Standard‑Build oder @ternlight/mini mit 5 MB, wenn du eine kleinere Variante willst. Beide funktionieren im Browser oder in einem Worker. Eine Zeile erledigt das: similar('easy weeknight dinner ideas', recipes, { topK: 3 }).

Warum das wichtig ist: Da Small‑Model‑ und On-Device‑KI zum Standard werden, macht Ternlight die Embedding‑Schicht vollständig lokal – das fehlende Puzzleteil für Browser‑Erweiterungen, Offline‑Suche und Edge‑Geräte.