Die Regel war früher einfach: Wer Geschwindigkeit will, nimmt ein kleineres Modell. OpenAI hat sie gerade gebrochen. Ultrafast Mode, am 13. August angekündigt, lässt GPT-5.6 Sol — das eigentliche Flaggschiff, kein destillierter Zwilling — mit bis zu 750 Ausgabetoken pro Sekunde laufen, das 14-fache seiner normalen 53 Tok/s. Die Geschwindigkeit stammt von Cerebras' Wafer-Scale-Hardware, dem ersten Produkt, das aus ihrer 10-Milliarden-Dollar-Partnerschaft ausgeliefert wird.
Was es tatsächlich ist
Eine API-Service-Stufe, kein neues Modell. Gleiche Gewichte, gleiche Intelligenz, das 14-fache der Ausgabe. Ein Datenpunkt: Alle 2.500 Fragen von Humanity’s Last Exam wurden in 11 Stunden statt 78 beantwortet, bei vergleichbarer Genauigkeit. OpenAIs Argumentation lautet „mehr nützliche Arbeit pro Sekunde“ — für Agent-Schleifen ist Latenz der eigentliche Engpass, und das greift ihn direkt an.
Wie man Zugang bekommt
Begrenzte API-Vorschau für eine kleine Kundengruppe. Noch keine Preisgestaltung, kein GA-Datum, noch keine öffentliche Modell-ID — der Zugriff erweitert sich, wenn die Cerebras-Kapazität wächst. Ziel-Workloads: Incident-Response, Echtzeit-Kundensupport, Finanz-Marktanalyse, E-Commerce-Agenten. Überall, wo eine 10-stufige Agent-Kette früher eine Kaffeepause bedeutete, bedeutet sie jetzt Sekunden.