Auto-Research mit Codex: 232-fach schnellerer QR-Kernel (GPU-Mode-Contest) — der Harness erledigte die Arbeit, nicht das Modell.

16. August 2026, 18:04

419.000 Mikrosekunden auf 1.805 reduziert. Das ist eine batchweise FP32-QR-Faktorisierung auf einem B200, und kein Mensch hat den Sieger‑Kernel geschrieben.

Was das eigentlich ist

Kein Produkt — ein reproduzierbares Agenten-Setup. Entwickler Sankalp nahm am Auto‑Research‑Wettbewerb von GPU Mode teil (batchweise quadratisches kompakt‑Householder‑QR, passend zu torch.geqrf) und richtete den /goal-Langschleifen‑Modus von GPT-5.5 Codex darauf aus. Vierzehn Tage, über 1.500 Einreichungen, 12. Platz von 183. Claude Pro stand daneben und erklärte die Mathematik. Gesamtkosten für Werkzeuge: $200 ChatGPT Pro, $20 Claude, plus Modal‑Credits für GPU‑ und NCU‑Profiling.

Der Teil, der es wert ist, kopiert zu werden

Die meisten Menschen führen Agenten als einstufiges Hill‑Climbing aus: ein Inhaber, ständig leichte Anpassungen. Sankalp nutzte Beam‑Search — 3 bis 5 Kandidaten‑Ideen‑Familien gleichzeitig aktiv, sodass eine Sackgasse nur einen Zweig kostet, nicht den gesamten Durchlauf. Der Speicher lag in einfachen Dateien: AGENTS.md für feste Regeln, problem_statement.md und Versuchs‑Logs, damit der Agent bereits verworfene Ideen nicht erneut versuchte.

Warum es wichtig ist

Dasselbe Codex‑CLI, das jeder hat. Die 232‑fache Beschleunigung stammt vom Schleifendesign. Jedes Problem mit einer editierbaren Datei und einer messbaren Zahl kann diese Form annehmen.