884 Punkte bei HackerNews, die größte KI‑Story des Tages. Alibaba hat gerade Qwen3.8-Max aus der Vorschau genommen: ein 2,4‑Billionen‑Parameter‑MoE‑Modell, das pro Anfrage nur 95 Mrd. aktiviert und für das Programmieren sowie langfristige Agenten‑arbeit gebaut wurde.
Die Zahlen, die zählen
Terminal‑Bench 2.1: 86,6 — über Claude Opus 4,8 und Fable 5 (84,6), nur hinter GPT‑5.6 Sol max (88,8). PaperBench: 93,0, vor allen Frontier‑Modellen. Alibaba sagt, es könne autonom über 10 + Tage hinweg programmieren, und das interne Team habe in 16 Tagen ein komplettes Software‑Engineering‑Projekt damit ausgeliefert.
API und offene Gewichte
Es ist live auf QwenCloud mit einer OpenAI‑kompatiblen API — richten Sie Ihren bestehenden Agenten‑Stack auf eine neue Basis‑URL aus und los. Offensichtliche Anwendungsfälle: Repository‑weite Refactorings, mehrtägige autonome Programmierläufe, Reproduzierung von Forschung. Die Gewichte werden nächste Woche auf Hugging Face und ModelScope veröffentlicht, zusammen mit einem kleineren Qwen3.8‑27B.
Warum das eine große Sache ist
Die Vorschau vor drei Wochen war nur ein Teaser. Dies ist GA plus ein Open‑Weights‑Commitment — ein offenes Modell tritt jetzt mit geschlossenen Frontier‑Flaggschiffen auf dem Benchmark an, das für agenten‑basiertes Programmieren am wichtigsten ist. Die Lücke schrumpft weiter.