Article
GPT-6 Astra knackt ARC-AGI-3: 99,9 Prozent und sparsamer als Menschen
Der ARC Prize hat die Ergebnisse von OpenAIs GPT-6 Astra auf ARC-AGI-3 veroeffentlicht - und spricht von einem spuerbaren Sprung in den Faehigkeiten aktueller Frontier-Modelle.
Die Zahlen
- Standard Harness: 62,7 Prozent im Semi-Private-Set fuer rund 26.000 Dollar
- Provider Adapter Harness (opakes Reasoning-State bleibt zwischen Anfragen erhalten): 99,9 Prozent fuer etwa 19.000 Dollar - beide Male State of the Art
- Kurios: Hoeheres Reasoning-Level kostet weniger, weil Astra die Spiele mit deutlich weniger Aktionen loest
Effizienter als der Mensch
Auf 96 Prozent der Level brauchte Astra weniger Aktionen als der menschliche Median, im Schnitt 51,7 Prozent weniger. ARC-AGI-3 testet Exploration, Modellierung, Zielsetzung und Planung in unbekannten, rundenbasierten Umgebungen - ganz ohne Anleitung, nur mit Core-Knowledge-Priors.
Wie Astra arbeitet
Besonders spannend: Astra verdichtet unbekannte Spielmechaniken zu kompakten symbolischen Weltmodellen - mit einer selbst entwickelten algebraischen Kurzschrift fuer Objekte, Regeln und mehrstufige Aktionsplaene, plus selbstgebauten Tools wie einem Maze-Solver.
ARC Prize betont: Benchmark-Saettigung ist kein AGI-Beweis, ARC-AGI-3 bleibt in Scope und Mechanik begrenzt. Kuenftig werden Standard- und Provider-Adapter-Ergebnisse im Leaderboard getrennt ausgewiesen.
Link: ARC Prize