Models

Z.ai veroeffentlicht GLM-5.3-Flash: Frontier-Intelligenz zum Zehntel-Preis

ai models llm

Z.ai hat mit GLM-5.3-Flash das erste nativ multimodale Modell der GLM-5-Serie vorgestellt. Das Mixture-of-Experts-Modell kombiniert 320 Milliarden Gesamtparameter mit nur 18 Milliarden aktivierten Parametern pro Token und unterbietet damit GLM-5.2 bei einem Zehntel der Kosten. In Coding- und Agenten-Benchmarks erreicht es Werte, die an Claude Opus 4.8 heranreichen. Vor dem offiziellen Release wurde das Modell anonym als “ox-alpha” auf OpenRouter getestet und avancierte sofort zum beliebtesten Modell der Woche – vollstaendig serviert auf chinesischen AI-Chips.

Architektur und Effizienz

  • Hybride Attention-Architektur: Kombination aus Sparse und Linear Attention reduziert Long-Context-Kosten bei 1M-Token-Kontext
  • IndexPool: Komprimiert vier Indexer-Key-Vektoren durch gewichtete Pooling zu einem
  • Manifold-Constrained Hyper-Connections (mHC): Verbessert Scaling-Effizienz
  • Schichten reduziert: 45 Layer gegenueber 92 bei GLM-4.5
  • 30T-Token multimodaler Pre-Training-Corpus

Benchmark-Highlights

  • Artificial Analysis Intelligence Index v4.1.1: Score 57 bei $0.045/Task (discounted)
  • DeepSWE v1.1: 63.4 (vs. 46.2 GLM-5.2)
  • AutomationBench: 48.8 (vs. 26.2 GLM-5.2)
  • Z.ai Code Bench v1.0: 29.0 bei max effort (vs. 29.5 Claude Opus 4.8)
  • Terminal Bench 2.1: 84.3
  • GPQA Diamond: 91.7 (Base-Modell: 88.1 MMLU, 86.6 BBH)

Visuelle Intelligenz und Deployment

Das Modell integriert Vision nativ fuer visuelles Coding: Frontend-Entwicklung, GUI-Judgement und Computer-Use-Agenten koennen gerenderte Outputs selbst verifizieren und iterativ verbessern. Im Bereich Office- und Wissensarbeit interpretiert das Modell Dokumente, Tabellen und Praesentationen direkt ohne zusaetzliche Text-Uebersetzung.

Die Produktionsskalierung laeuft auf einem grossen Cluster chinesischer AI-Chips mit SGLang-basiertem Inference-Engine. Eine Encode-Prefill-Decode(EPD)-Disaggregationsarchitektur trennt Encoding, Prefill und Decoding in unabhaengige Worker-Pools – mit 3x Performance-Steigerung gegenueber dem Initial-Baseline.

Verfuegbarkeit

  • API: Z.ai Coding Plan (3x Quota gegenueber GLM-5.3)
  • ZCode: Browser Use und Computer Use fuer multimodale Agenten
  • Open Weights: HuggingFace
  • Inference-Frameworks: SGLang, vLLM, TokenSpeed
  • Kontextlaenge: bis zu 1 Million Token

Quelle: GLM-5.3-Flash: Frontier Intelligence, Flash Cost