Wie weit ist die KI davon entfernt, eigenständig KI-Forschung zu betreiben? Prime Intellect hat gerade eine Zahl dafür angegeben: 82 %.
NanoGPT Speedrun Frontier ist kein Produkt – es ist das bislang größte offene Experiment zur autonomen KI-Forschung. 153 vollständig autonome Durchläufe, 18 Frontier‑Modelle (Fable 5, Opus 5, GPT‑5.6 Sol, Kimi K3, Grok 4.6, DeepSeek V4 Pro, Qwen 3.8 …), jeder Agent in einer Sandbox mit 8 × H200‑GPUs für bis zu 8 Tage eingeschlossen. Kein Internet. Eine Aufgabe: das Optimierer‑Rezept für das Training eines 124 M‑Parameter‑nanoGPT iterieren und die Uhr schlagen.
Die 82 %-Zahl
Der menschliche Rekord erforderte Dutzende von Forschern monatelange kollektive Anstrengungen. Fable 5, das allein lief, schloss 81,7 % der Lücke vom Basiswert zu diesem Rekord – 2 726 Schritte gegenüber den menschlichen 2 600. Agenten führten pro Durchlauf bis zu 963 Experimente aus und verbrauchten bis zu 2,9 Mrd. Tokens. Hypothese, Experiment, Fehlanalyse: Die Schleife funktioniert. Was noch fehlt, ist die wirklich neue algorithmische Idee.
Warum das wichtig ist
Jeder behauptet, sein Modell „führt Forschung durch.“ Dies ist der erste groß angelegte Versuch, dies zu messen – und alles ist offen: Code, Ergebnisse sowie 41 vollständige Agenten‑Trajektorien mit Tool‑Aufrufen und Scratchpads. Es erreichte aus gutem Grund 62 Punkte auf der HackerNews‑Frontpage.