Können 5.1 B aktive Parameter mit einem 1T-Flaggschiff mithalten? Ling-3.0-flash (Ant Group inclusionAI) sagt ja

7. August 2026, 18:07

Ant Group’s inclusionAI hat ein 124B-MoE-Modell ausgeliefert, das pro Token nur ~5,1 B Parameter aktiviert – 1/8 der Größe und 1/12 der aktiven Rechenleistung seines eigenen 1 T-Flaggschiffs – und behauptet, es liege den meisten Benchmarks gleich oder übertreffe sie. Diese Behauptung stammt derzeit nur vom Anbieter, es gibt noch keine öffentliche Benchmark-Tabelle. Aber die Architektur ist die eigentliche Geschichte.

Die Architektur-Wette

Dies ist kein verkleinertes Flaggschiff. Ling-3.0-flash verwendet native hybride lineare Aufmerksamkeit aus dem Pre‑Training: Kimi-Delta-Attention (ja, Moonshots KDA) im Verhältnis 5:1 mit MLA gestapelt, plus 1/64 Experten-Sparsamkeit. Ergebnis: 256 K Kontext, ~1.000 Tokens/Sekunde laut Ant‑Infrastruktur, 1 M Kontext in der Roadmap. Chinesische Labore leihen sich jetzt offen die Aufmerksamkeits-Forschung der anderen aus – so schnell beschleunigt sich dieses Rennen.

Kostenlose API, jetzt sofort

Sie ist OpenAI-kompatibel und für begrenzte Zeit kostenlos über OpenRouter (inclusionai/ling-3.0-flash), ZenMux und Novita verfügbar. Werkzeug-Nutzung und Funktions-Aufruf funktionieren, und der Wechsel zwischen Denk- und Nicht-Denk-Modus plus günstige aktive Rechenleistung machen sie für Agent-Workloads gebaut – lange mehrstufige Werkzeugketten, bei denen Token-Kosten normalerweise tödlich sind. Als Open-Weight unter Apache 2.0 angekündigt; die Gewichte sind noch nicht auf Hugging Face gelandet. Beobachten Sie, ob sie tatsächlich ausgeliefert werden.