Fermion Research nahm Qwen3-8B, führte ternäre quantisierungsbewusste Schulung durch und destillierte einen 8,19B Decoder, der als eine 3,88 GB Datei ausgeliefert wird. Alle 252 linearen Schichten werden in einem dreistufigen Gewichtformat gespeichert, das 8‑mal kleiner ist als fp16, und innerhalb der Matrix-Kernels dekodiert. Er erreichte HackerNews am Tag seiner Veröffentlichung, 2026-07-27.
Was es wirklich ist
Ein Open-Weights-Sprachmodell, kein Tool und keine App. Die Werte halten für seine Größe – MMLU 72,1, IFEval 77,2, BFCL 68,9 – also ist dies keine Kompression, die das Modell aushöhlt, um eine Dateigröße zu erreichen. Es liefert ein 0,6B Entwurfs-Modell für spekulatives Dekodieren, das nur Tokens akzeptiert, die dem Argmax des 8B entsprechen, sodass Sie die Geschwindigkeitssteigerung erhalten, während die Ausgabe identisch mit einfachem Greedy ist.
Selbst ausführen
Gewichte sind auf Hugging Face in einem TRTC v4 Container. Kommerzielle Nutzung, Feinabstimmung und Weiterverteilung sind alle unter Apache 2.0 offen – keine Zugriffsanfrage, kein Formular. Da das Single-Stream-Dekodieren durch die pro Token verschobenen Bytes begrenzt ist, läuft ein 3,88 GB Arbeits-Set schneller als ein 16 GB fp16-Build im gleichen Speicher und passt neben seinem KV-Cache auf einer 8 GB GPU oder einem 16 GB Laptop. Das ist der Punkt: ein SOTA-Klassen-8B, das Sie auf fast jedes Gerät legen können.