Models

NanoGPT Speedrun: 18 KI-Modelle im autonomen Optimierungs-Wettbewerb

ai llm benchmark prime-intellect

Prime Intellect hat mit dem NanoGPT Speedrun Frontier einen faszinierenden Benchmark veröffentlicht: 153 autonome Laeufe ueber 18 verschiedene Frontier-Modelle, die alle dieselbe Aufgabe hatten – die Optimierung eines nanoGPT-Modells. Das Ergebnis ist ein umfassendes Bild darueber, welche Modelle sich fuer autonome Code-Optimierung eignen.

Die Spitzenreiter

Fable 5 (ueber Claude Code) erzielte mit 2.726 Punkten den besten Wert und schloss 81,7% der Lucke zum menschlichen Rekord. Dicht dahinter folgten Opus 5 mit 53,6% und Kimi K3 mit 52,2% Gap Closed. Interessant: Kimi K3 erreichte diesen Wert mit dem “prime-agent”-Harness, waehrend es ueber den natuerlichen kimi-code-Harness nur auf 45,8% kam – die Harness-Wahl macht also einen massiven Unterschied.

Token-Effizienz vs. Performance

Die Tabelle offenbart drastische Unterschiede im Token-Verbrauch: GPT-5.6 Sol verbrauchte 2,9 Milliarden Token ueber 6,1 Tage, waehrend Fable 5 mit 800M Token in 8,7 Tagen auskam. GLM 5.2 erreichte mit nur 57M Token immerhin 20,3% Gap Closed – beeindruckende Effizienz fuer ein kleineres Modell.

Fazit

Der Benchmark zeigt, dass nicht immer das groesste Modell gewinnt. Harness-Entwicklung, Token-Budget und Laufzeit spielen eine equally wichtige Rolle. Claude Code-basierte Harnesses dominieren das Feld, aber Open-Source-Modelle wie Kimi K3 und Qwen3.8 Max beweisen, dass sie konkurrenzfaehig sind.

Originalartikel: Prime Intellect Research