Das Team von Alibaba, Qwen, hat am 26. August Qwen3.8-Flash-Next als Open-Source-Code veröffentlicht — ein 125B multimodales MoE-Modell, das nur 6B Parameter pro Token aktiviert. Es ist der erste öffentliche Blick auf die Qwen4-Architektur — kein Papier, tatsächliche Gewichte auf Hugging Face (qwen-community-1.0-Lizenz).
Was die neue Architektur ändert
Die Geschichte handelt nicht von der Größe, sondern von den Kosten. GDN + QSA-Hybrid-Attention (drei von vier Schichten führen lineare Attention durch), Gated Residual, eine 51B N-Gram-Einbettungstabelle und der Muon-Optimierer reduzieren die Trainingskosten auf etwa 1/9 von Qwen3.7-Plus — während es dieses in allen Bereichen schlägt. Die größten Gewinne erzielt die Codierung: 62,5 auf SWE-bench Pro, 91,9 auf LiveCodeBench v6. Der Kontext beträgt 262K nativ, 1M mit YaRN, mit bis zu 7,6× schnellerem Vorfüllen am langen Ende.
Jetzt ausführen oder die API verwenden
Die Gewichte laufen bereits auf vLLM, SGLang und llama.cpp — Simon Willison hatte quantisierte Builds ab dem ersten Tag. Die Produktionsversion trifft die QwenCloud-API für 0,16 $/1M Eingabe und 0,47 $/1M Ausgabe, Preise, die für Agenten konzipiert sind, die den ganzen Tag lang Token verbrauchen: Coding-Agenten, Büromitarbeiter für lange Dokumente, Video-Understanding. Es treibt bereits Qwen Code und QwenWork an.
Wenn 6B aktive Parameter mit einem Flaggschiff mithalten können, wird die Inferenzrechnung für alle anderen zu einer strategischen Frage.