Qwen3.8-2.4T-A95B Open-Weights-Land: 2,4 T Parameter, und Sie können das Denken nicht ausschalten.

13. August 2026, 00:05

Alibaba hat gerade sein Max-tier-Modell auf Hugging Face und ModelScope gestellt. Qwen3.8-2.4T-A95B ist ein reiner Text-MoE — 2,4 Billionen Gesamtparameter, ~95 Mrd. aktiv pro Token, 512 Experten, von denen gleichzeitig 11 feuern, über einen 92‑schichtigen hybriden Attention-Stack. Das größte Open-Weight-Modell, das jemals veröffentlicht wurde. HN hat es mit 395 Punkten auf die Titelseite gesetzt.

Zwei Einschränkungen, die Sie kennen sollten, bevor Sie 2,4 T Gewichte herunterladen: keine multimodale Eingabe und der Denkmodus ist obligatorisch. Jede Antwort gibt zuerst eine Gedankenkette aus. Es gibt keine Option, dies zu deaktivieren.

Was Sie tatsächlich dafür verwenden

Gewichte werden im Transformers-Format geliefert, mit Day-0-Unterstützung in vLLM, SGLang und TokenSpeed. Alibaba hat außerdem eine FP8-Version (feinkörnig, Blockgröße 128) veröffentlicht, die fast nichts verliert, und unsloth bietet bereits GGUF-Builds an. Der Kontext beträgt 262 K nativ, erweiterbar auf ~1 M.

Wenn Sie keinen Rack haben, hostet DashScope es für 2 $ pro Million Eingabetoken und 6 $ pro Ausgabe, hinter OpenAI‑, Anthropic‑ und DashScope‑kompatiblen Endpunkten. Der typische Anwendungsfall ist der offensichtliche: Lang-Kontext-Agenten, Codierung, tiefe Forschungs-Loops.

Warum es wichtig ist

Dass die geschlossene Max-tier-Fähigkeit offen wird, ist die eigentliche Geschichte — GPQA Diamond 92,6, SWE-bench Pro 67,7. Noch immer unter dem Wert von Fable 5’s 80,0, aber es ist das stärkste, das Sie selbst hosten können. Ein Haken: Es steht unter einer benutzerdefinierten „qwen3.8-max“-Lizenz, nicht unter Apache. Open-Weights, nicht Open-Source.