Google hat am 21. Juli drei Flash-Modelle veröffentlicht, die alle dasselbe Problem adressieren — Agenten, die tausende von Schritten ausführen und dabei Token verbrauchen.
3.6 Flash verwendet 17 % weniger Ausgabetoken als 3.5 Flash und erzielt dennoch bessere Werte dort, wo Agenten eingesetzt werden: DeepSWE code editing 49 % gegenüber 37 %, MLE Bench 63,9 % gegenüber 49,7 %, OSWorld-Verified computer use 83,0 % gegenüber 78,4 %. Der Preis sank auf $1.50/$7.50 pro Million Token, gegenüber zuvor $9 für die Ausgabe.
3.5 Flash-Lite ist das laute Modell. 350 Ausgabetoken pro Sekunde, Terminal-Bench 2,1 von 31 % auf 54 %, SWE-Bench Pro 54,2 % — bei $0.3/$2.5, etwa ein Fünftel des Preises von Flash. Fast die Verdopplung eines agentenbezogenen Benchmarks bei gleichzeitiger Kostensenkung um 80 % ist das gesamte Verkaufsargument.
Wo es einsetzen
Beide sind in der Gemini-API über Google AI Studio, Gemini Enterprise, Android Studio, die Gemini-App und GitHub Copilot verfügbar. Das offensichtliche Muster: 3.6 Flash als Orchestrierungs- und Denk-Schicht, Flash-Lite als günstiger Arbeiter, der unten wiederholte Tool-Aufrufe abarbeitet.
Das Modell, das Google nicht verkauft
3.5 Flash Cyber entdeckt Schwachstellen, in Kombination mit dem CodeMender agent, auf Frontier-Level im CyberGym. Es wird nur an Regierungen und vertrauenswürdige Partner in einem begrenzten Pilotprojekt ausgeliefert. Zum ersten Mal hat ein großes Labor offensive Sicherheit in sein eigenes SKU integriert und dann darauf verzichtet, es zu listen — ein Fähigkeitsnachweis, der als Produkt verpackt ist.