Models

Grok 4.6 von xAI erreicht Frontier-Niveau bei agentic Benchmarks

grok xai benchmark llm

xAI hat Grok 4.6 veroeffentlicht, das Modell entwickelt sich mit Schwerpunkt auf langlaufende Agenten und interaktive sowie visuelle Aufgaben weiter. Auf dem Artificial Analysis Intelligence Index erzielt Grok 4.6 einen Wert von 61 Punkten und liegt damit gleichauf mit GPT-5.6 Sol sowie nur knapp hinter Claude Opus 5 (63) und Claude Fable 5 (62). Gegenueber dem Vorgaenger Grok 4.5 bedeutet das ein Plus von 5 Punkten, gegenueber Grok 4.3 sogar 23 Punkte.

Besonders stark ist das Modell in agentic Szenarien: Im GDPval-AA v2 erreicht es einen Elo-Wert von 1753, nur hinter Claude Opus 5. Bei Terminal-Bench v2.1 erzielt es 88,4 Prozent, bei tau-Banking 50,7 Prozent. Im AA-Briefcase-Benchmark fuer langfristige Wissensaufgaben erreicht es Elo 1577 und benoetigt dabei rund 53 Turns und 0,5 Milliarden Input-Token, waehrend Claude Opus 5 rund 103 Turns und 2,0 Milliarden Token benoetigt.

Die Preise bleiben mit 2 Dollar je Million Input-Token und 6 Dollar je Million Output-Token unveraendert, ueber 60 Prozent guenstiger als Claude Opus 5 oder GPT-5.6 Sol. Der Kontext umfasst 500.000 Token. Verfuegbar ist Grok 4.6 ueber Cursor, Grok Build, die API sowie OpenRouter, Vercel und Cloudflare.

Originalquelle: Artificial Analysis | xAI