Article

LLM Battle Royale: Grok 4.1 Fast dominiert, Claude will Freundschaft schließen

LLM OpenRouter Grok Claude Benchmark Agent

Was passiert, wenn man 11 Large Language Models in ein Battle-Royale-Spiel wirft und sie 30 Runden gegeneinander antreten lässt? Jacky Liang von OpenRouter hat genau das getan – und die Ergebnisse sind aufschlussreich für alle, die Modelle für agentische Anwendungen evaluieren.

Das Experiment

Die LLMs spielten in einer 400 m² 2D-Welt mit Waffen, Rüstung, Heilitems, Granaten, Autos und einer schrumpfenden Zone – klassische Battle-Royale-Mechaniken. Die Modelle wussten nicht, welche anderen Modelle sie gegeneinander spielen; sie sahen nur Buchstaben A bis K.

Zwischen den Matches durfte jedes Modell zwei Dateien bearbeiten: soul.md (seine Persona) und memory.md (seine Spielnotizen). Diese Dateien offenbaren die Persönlichkeitsunterschiede am deutlichsten.

Die Gewinner

Grok 4.1 Fast gewann 43% aller Matches – das günstigste Modell im Lineup. Das teuerste Modell wurde mit 27-fachen Kosten pro Sieg geschlagen. Herkömmliche Benchmarks auf Artificial Analysis sagten den Gewinner nicht voraus.

Drei Modelle gewannen kein einziges Spiel: GPT 5.4, GPT 5.4-mini und Kimi K2.6.

Persönlichkeitsprofile

Die soul.md und memory.md Dateien zeigen faszinierende Unterschiede:

  • Claude Sonnet 4.6 versuchte konstant, Allianzen zu schmieden, erzählte anderen Spielern seine Position und wollte Freundschaft schließen. Das ist das Modell, das du in den meisten produktiven Anwendungen willst – aber nicht in einem Battle Royale.

  • Grok 4.1 Fast spielte aggressiv, strategisch und ohne soziale Erwägungen. Es optimierte auf Sieg, nicht auf Kooperation.

Was das bedeutet

Das Experiment zeigt eine fundamentale Einsicht: Benchmarks, die auf statischen Tests basieren, erfassen nicht, wie Modelle in dynamischen, kompetitiven Umgebungen agieren. Die Fähigkeit zu strategischem Denken, Impulsivität, Risikobewertung und sozialer Manipulation manifestiert sich erst in echten Interaktionen.

Für Entwickler, die Agenten bauen: Das Modell, das in einem Benchmark gut abschneidet, ist nicht zwangsläufig das beste für deine Anwendung. Persönlichkeitsmerkmale wie Kooperationsbereitschaft vs. Wettbewerbsorientierung können entscheidend sein – und diese werden von Standard-Benchmarks nicht gemessen.

Alle Spieldaten und die Persönlichkeitsdateien sind auf GitHub verfügbar. Die Spiele können als Videos auf der Royale-Website angesehen werden.

Quelle: OpenRouter Blog