GPT-5.6 Sol kann mathematische Probleme knacken, doch es erzielte lächerliche 13,3 % bei ARC-AGI-3, einer Sammlung von 2D-Puzzle-Spielen. Am 31. Juli veröffentlichte OpenAI die Autopsie, und der Schuldige war nicht das Modell.
Das Harness hat das Modell ausgehungert
Der offizielle ARC-AGI-3-Runner verwirft das Denken des Modells nach jedem einzelnen Zug, und sobald der Kontext voll ist, löscht er die frühesten Aktionen. So wacht der Agent jedes Mal amnesisch auf und leitet das Spiel von Grund auf neu ab. Schaltet man zwei Schalter in der Responses-API ein – retained reasoning (die Gedankenkette über Züge hinweg beibehalten) und compaction (alten Kontext zusammenfassen, anstatt ihn zu verwerfen) –, springt die Punktzahl auf 38,3 %. Außerdem werden 6‑mal weniger Ausgabetoken verbraucht.
Warum Entwickler*innen das wichtig ist
Dies ist kein neuer Modell-Launch. OpenAI gibt zu, dass ein Benchmark Ihr Harness genauso misst wie Ihre Gewichte. Jeder Entwickler, der Agenten baut, kann das heute reproduzieren: dieselben zwei Parameter, dieselbe API, kein Fine-Tuning. Die unbequeme Erkenntnis – gute Kontext-Engineering kann mehrere Modell-Upgrades, die übereinander gestapelt sind, übertreffen.