Models
Z.ai veroeffentlicht GLM-5.3-Flash: Frontier-Intelligenz zum Zehntel-Preis
Z.ai hat mit GLM-5.3-Flash das erste nativ multimodale Modell der GLM-5-Serie vorgestellt. Das Mixture-of-Experts-Modell kombiniert 320 Milliarden Gesamtparameter mit nur 18 Milliarden aktivierten Parametern pro Token und unterbietet damit GLM-5.2 bei einem Zehntel der Kosten. In Coding- und Agenten-Benchmarks erreicht es Werte, die an Claude Opus 4.8 heranreichen. Vor dem offiziellen Release wurde das Modell anonym als “ox-alpha” auf OpenRouter getestet und avancierte sofort zum beliebtesten Modell der Woche – vollstaendig serviert auf chinesischen AI-Chips.
Architektur und Effizienz
- Hybride Attention-Architektur: Kombination aus Sparse und Linear Attention reduziert Long-Context-Kosten bei 1M-Token-Kontext
- IndexPool: Komprimiert vier Indexer-Key-Vektoren durch gewichtete Pooling zu einem
- Manifold-Constrained Hyper-Connections (mHC): Verbessert Scaling-Effizienz
- Schichten reduziert: 45 Layer gegenueber 92 bei GLM-4.5
- 30T-Token multimodaler Pre-Training-Corpus
Benchmark-Highlights
- Artificial Analysis Intelligence Index v4.1.1: Score 57 bei $0.045/Task (discounted)
- DeepSWE v1.1: 63.4 (vs. 46.2 GLM-5.2)
- AutomationBench: 48.8 (vs. 26.2 GLM-5.2)
- Z.ai Code Bench v1.0: 29.0 bei max effort (vs. 29.5 Claude Opus 4.8)
- Terminal Bench 2.1: 84.3
- GPQA Diamond: 91.7 (Base-Modell: 88.1 MMLU, 86.6 BBH)
Visuelle Intelligenz und Deployment
Das Modell integriert Vision nativ fuer visuelles Coding: Frontend-Entwicklung, GUI-Judgement und Computer-Use-Agenten koennen gerenderte Outputs selbst verifizieren und iterativ verbessern. Im Bereich Office- und Wissensarbeit interpretiert das Modell Dokumente, Tabellen und Praesentationen direkt ohne zusaetzliche Text-Uebersetzung.
Die Produktionsskalierung laeuft auf einem grossen Cluster chinesischer AI-Chips mit SGLang-basiertem Inference-Engine. Eine Encode-Prefill-Decode(EPD)-Disaggregationsarchitektur trennt Encoding, Prefill und Decoding in unabhaengige Worker-Pools – mit 3x Performance-Steigerung gegenueber dem Initial-Baseline.
Verfuegbarkeit
- API: Z.ai Coding Plan (3x Quota gegenueber GLM-5.3)
- ZCode: Browser Use und Computer Use fuer multimodale Agenten
- Open Weights: HuggingFace
- Inference-Frameworks: SGLang, vLLM, TokenSpeed
- Kontextlaenge: bis zu 1 Million Token