Article

GLM-5.2 dominiert Artificial Analysis Intelligence Index als führendes Open-Weights-Modell

AI GLM Zhipu Benchmark Open Source LLM

Der Benchmark

Artificial Analysis hat GLM-5.2 auf dem Intelligence Index v4.1 getestet. Das Ergebnis:

ModellIntelligence Index
GLM-5.251
MiniMax-M344
DeepSeek V4 Pro (max)44
Kimi K2.643

GLM-5.2 ist das führende Open-Weights-Modell – mit 11 Punkten Vorsprung auf seinen Vorgänger GLM-5.1.

Was verbessert wurde

Gleiche Größe (744B total / 40B active parameters), aber deutlich besser:

  • Scientific Reasoning: CritPt +16 Punkte (21%), HLE +12 Punkte (40%)
  • Code: TerminalBench v2.1 +16 Punkte (78%)
  • Agent Performance: AA-LCR +9 Punkte (71%), tau3 banking +15 Punkte (27%)

GDPval-AA v2: Agent-Performance

GLM-5.2 dominiert GDPval-AA v2 (Real-World Agentic Performance):

  • GLM-5.2: 1524
  • MiniMax-M3: 1418
  • DeepSeek V4 Pro (max): 1328
  • GPT-5.5 (xhigh): 1514

Damit liegt GLM-5.2 auf Augenhöhe mit proprietären Modellen wie GPT-5.5.

Kosten-Effizienz

GLM-5.2 liegt auf der Pareto-Frontier von Intelligence vs Cost per Task:

  • ~$0.46 pro Task
  • Tiefster Cost-per-Task für Modelle auf diesem Intelligenzlevel
  • API-Pricing: $1.4/$0.26/$4.4 per 1M input/cache hit/output tokens

Verfügbarkeit

  • Z.ai First-Party API
  • Third-Party Provider: DeepInfra, Novita, Nebius, Parasail, Siliconflow, GMI Cloud, Baseten, Fireworks
  • Lizenz: MIT (keine regionalen Limits)
  • Context Window: 1M Tokens (vs. 200K bei GLM-5.1)

Die Botschaft: Open-Weights-Modelle holen auf – GLM-5.2 ist nicht mehr nur “gut für Open Source”, sondern konkurrenzfähig mit kommerziellen Frontier-Modellen bei Agent-Aufgaben.