Models
NanoGPT Speedrun: 18 KI-Modelle im autonomen Optimierungs-Wettbewerb
Prime Intellect hat mit dem NanoGPT Speedrun Frontier einen faszinierenden Benchmark veröffentlicht: 153 autonome Laeufe ueber 18 verschiedene Frontier-Modelle, die alle dieselbe Aufgabe hatten – die Optimierung eines nanoGPT-Modells. Das Ergebnis ist ein umfassendes Bild darueber, welche Modelle sich fuer autonome Code-Optimierung eignen.
Die Spitzenreiter
Fable 5 (ueber Claude Code) erzielte mit 2.726 Punkten den besten Wert und schloss 81,7% der Lucke zum menschlichen Rekord. Dicht dahinter folgten Opus 5 mit 53,6% und Kimi K3 mit 52,2% Gap Closed. Interessant: Kimi K3 erreichte diesen Wert mit dem “prime-agent”-Harness, waehrend es ueber den natuerlichen kimi-code-Harness nur auf 45,8% kam – die Harness-Wahl macht also einen massiven Unterschied.
Token-Effizienz vs. Performance
Die Tabelle offenbart drastische Unterschiede im Token-Verbrauch: GPT-5.6 Sol verbrauchte 2,9 Milliarden Token ueber 6,1 Tage, waehrend Fable 5 mit 800M Token in 8,7 Tagen auskam. GLM 5.2 erreichte mit nur 57M Token immerhin 20,3% Gap Closed – beeindruckende Effizienz fuer ein kleineres Modell.
Fazit
Der Benchmark zeigt, dass nicht immer das groesste Modell gewinnt. Harness-Entwicklung, Token-Budget und Laufzeit spielen eine equally wichtige Rolle. Claude Code-basierte Harnesses dominieren das Feld, aber Open-Source-Modelle wie Kimi K3 und Qwen3.8 Max beweisen, dass sie konkurrenzfaehig sind.
Originalartikel: Prime Intellect Research