Article
GLM-5.2 dominiert Artificial Analysis Intelligence Index als führendes Open-Weights-Modell
Der Benchmark
Artificial Analysis hat GLM-5.2 auf dem Intelligence Index v4.1 getestet. Das Ergebnis:
| Modell | Intelligence Index |
|---|---|
| GLM-5.2 | 51 |
| MiniMax-M3 | 44 |
| DeepSeek V4 Pro (max) | 44 |
| Kimi K2.6 | 43 |
GLM-5.2 ist das führende Open-Weights-Modell – mit 11 Punkten Vorsprung auf seinen Vorgänger GLM-5.1.
Was verbessert wurde
Gleiche Größe (744B total / 40B active parameters), aber deutlich besser:
- Scientific Reasoning: CritPt +16 Punkte (21%), HLE +12 Punkte (40%)
- Code: TerminalBench v2.1 +16 Punkte (78%)
- Agent Performance: AA-LCR +9 Punkte (71%), tau3 banking +15 Punkte (27%)
GDPval-AA v2: Agent-Performance
GLM-5.2 dominiert GDPval-AA v2 (Real-World Agentic Performance):
- GLM-5.2: 1524
- MiniMax-M3: 1418
- DeepSeek V4 Pro (max): 1328
- GPT-5.5 (xhigh): 1514
Damit liegt GLM-5.2 auf Augenhöhe mit proprietären Modellen wie GPT-5.5.
Kosten-Effizienz
GLM-5.2 liegt auf der Pareto-Frontier von Intelligence vs Cost per Task:
- ~$0.46 pro Task
- Tiefster Cost-per-Task für Modelle auf diesem Intelligenzlevel
- API-Pricing: $1.4/$0.26/$4.4 per 1M input/cache hit/output tokens
Verfügbarkeit
- Z.ai First-Party API
- Third-Party Provider: DeepInfra, Novita, Nebius, Parasail, Siliconflow, GMI Cloud, Baseten, Fireworks
- Lizenz: MIT (keine regionalen Limits)
- Context Window: 1M Tokens (vs. 200K bei GLM-5.1)
Die Botschaft: Open-Weights-Modelle holen auf – GLM-5.2 ist nicht mehr nur “gut für Open Source”, sondern konkurrenzfähig mit kommerziellen Frontier-Modellen bei Agent-Aufgaben.