GPT-5.6 Sol auf Cerebras — 750 Token/s: OpenAIs Spitzenmodell wird im Juli 15-mal schneller

3. Juli 2026, 00:09

OpenAI wird seine Flaggschiff‑Version GPT-5.6 Sol ab Juli auf der Cerebras‑Infrastruktur bereitstellen, mit bis zu 750 Token pro Sekunde – etwa das 15‑fache des heutigen Basiswerts von ~50 Token/s der API‑Stufen. Kein neues Modell, kein neuer Benchmark. Nur Geschwindigkeit. Und das ist der Punkt.

Warum 750 Token/s das Spiel für Agenten verändert

Grenzmodelle haben immer einen Kompromiss erzwungen: intelligent, aber langsam, oder schnell, aber dumm. Sol ist das stärkste Modell von OpenAI – Spitzenklasse beim Codieren, Schließen und agentenbezogenen Aufgaben – und Latenz war die Steuer, die Sie dafür zahlten. Bei 750 Token/s beendet ein 20-Schritte-Agenten-Loop, der Minuten dauerte, in Sekunden. Echtzeit‑Sprachausgabe mit Grenz‑Level‑Reasoning hört auf, eine Demo zu sein. Coding‑Agenten iterieren schneller, als Sie prüfen können.

Der zugrunde liegende Deal sei ein Cloud‑Abkommen im Wert von 20 Milliarden $ zwischen OpenAI und Cerebras. OpenAI wettet darauf, dass Inferenz‑Geschwindigkeit, nicht nur rohe Intelligenz, die nächste Wettbewerbs‑Achse wird.

Wie man Zugriff erhält

Über die OpenAI‑API und Codex – aber GPT-5.6 befindet sich noch in einer limitierten Vorschau für vertrauenswürdige Partner, und die Cerebras‑Kapazität wird zunächst ausgewählten Kunden bereitgestellt. Die Sol‑Preisgestaltung liegt bei 5 $ Eingabe / 30 $ Ausgabe pro 1 Mio. Token. Wenn Sie Agenten‑Loops oder Echtzeit-Sprach-Apps entwickeln, ist dies der Zugriff, auf den es sich zu warten lohnt.