Models

GLM-5.3 kraenzt die Konkurrenz aus: Open-Weight-Modell dominiert Real-World-Benchmark

llm glm benchmark open-source

Der Ed-o-meter von Reinvently ist mal ehrlich geblieben: kein akademisches Gemesssel, sondern 28 echte Aufgaben — Coding, Datenverarbeitung, Real-World-Requests, Security-Canaries und Tool-Use — identisch durchgeschickt bei 17 Modellen. Ein Harness, gleiche Prompts, deterministisches Grading. Das ganze Suite kostet gerade mal $30.

GLM-5.3 holt 100%

Das Open-Weight-Modell aus dem Zhipu/THUDM-Lager ist der erste Kandidat, der alle fuenf Disziplinen mit 100% Pass-Rate abschliesst — Coding, Data, Realworld, Security und Tool-Use. Ein 9.3-Rubric-Score (Platz 3 hinter kimi-k3 mit 9.5) und eine perfekte Security-Bilanz runden das Bild ab.

Ein Fuenftel der Kosten

  • GLM-5.3: $0.28 fuer die komplette Runde, $0.0101 pro Task
  • GPT-5.5: $1.43 fuer dieselbe Runde — gut fuenfmal so teuer bei 96% Pass-Rate
  • Sonnet-4-6: $1.84 — teuerstes Modell im Feld, ebenfalls 96%
  • Opus-5: $1.67, aber nur 86% wegen Provider-seitiger Task-Blockaden

Der einzige Wermutstropfen: 16.3 Sekunden Time-to-First-Token. Wer’s schneller braucht, greift zu GPT-5.5 (13.2s) oder Haiku-4-5 (0.9s, aber nur 7.4 Rubric).

Was sonst noch aufgefallen ist

  • GPT-5.6-Familie knallt die Security-Canaries in 11 von 12 Zellen — 33 bis 50% Pass-Rate. Vorsicht bei untrusted Prompts.
  • Fable-5 und Opus-5 verweigern harmlose Coding-Tasks wegen eines ueberaggressiven Provider-Filters — Messartefakt, kein Modell-Problem.
  • DeepSeek-V4-Pro ist mit $0.0029/Task das guenstigste 96%-Modell, aber 40s TTFT disqualifizieren es fuer alles Interaktive.
  • GPT-5.6-Luna bleibt der Billig-Workhorse ($0.0023/Task), aber 33% Security machen es nichts fuer sicherheitsrelevante Workflows.

Das Test-Harness ist uebrigens Open Source — Featherbench unter MIT-Lizenz. Klonen, selbst laufen lassen, eigene Modelle via GitHub-Issue vorschlagen.

Originalquelle: The Ed-o-meter — Reinvently