OpenAI Ultrafast‑Modus (GPT-5.6 Sol mit 14‑facher Geschwindigkeit): 750 Token/s, derselbe Flaggschiff‑Brain

15. August 2026, 06:05

Die Regel war früher einfach: Wer Geschwindigkeit will, nimmt ein kleineres Modell. OpenAI hat sie gerade gebrochen. Ultrafast Mode, am 13. August angekündigt, lässt GPT-5.6 Sol — das eigentliche Flaggschiff, kein destillierter Zwilling — mit bis zu 750 Ausgabetoken pro Sekunde laufen, das 14-fache seiner normalen 53 Tok/s. Die Geschwindigkeit stammt von Cerebras' Wafer-Scale-Hardware, dem ersten Produkt, das aus ihrer 10-Milliarden-Dollar-Partnerschaft ausgeliefert wird.

Was es tatsächlich ist

Eine API-Service-Stufe, kein neues Modell. Gleiche Gewichte, gleiche Intelligenz, das 14-fache der Ausgabe. Ein Datenpunkt: Alle 2.500 Fragen von Humanity’s Last Exam wurden in 11 Stunden statt 78 beantwortet, bei vergleichbarer Genauigkeit. OpenAIs Argumentation lautet „mehr nützliche Arbeit pro Sekunde“ — für Agent-Schleifen ist Latenz der eigentliche Engpass, und das greift ihn direkt an.

Wie man Zugang bekommt

Begrenzte API-Vorschau für eine kleine Kundengruppe. Noch keine Preisgestaltung, kein GA-Datum, noch keine öffentliche Modell-ID — der Zugriff erweitert sich, wenn die Cerebras-Kapazität wächst. Ziel-Workloads: Incident-Response, Echtzeit-Kundensupport, Finanz-Marktanalyse, E-Commerce-Agenten. Überall, wo eine 10-stufige Agent-Kette früher eine Kaffeepause bedeutete, bedeutet sie jetzt Sekunden.