Article
GLM-5.2 auf lokaler Hardware mit Unsloth
GLM-5.2 ist Z.ai’s neuestes offenes Modell mit beeindruckenden Spezifikationen: 744 Milliarden Parameter, 40 Milliarden aktive Parameter und ein 1M Kontextfenster. Das Modell liefert SOTA-Performance in Coding, Reasoning und Agent-Tasks. Unsloth bietet nun Dynamic GGUF-Quantisierungen, die das Modell auf Consumer-Hardware zugänglich machen.
Hardware-Anforderungen
Die quantisierten Versionen benötigen deutlich weniger Speicher als das Original:
| Quantisierung | Speicherbedarf |
|---|---|
| 1-bit Dynamic | 223 GB |
| 2-bit Dynamic | 245 GB |
| 3-bit Dynamic | 290-360 GB |
| 4-bit Dynamic | 372-475 GB |
| 5-bit Dynamic | 570 GB |
| 8-bit | 810 GB |
Die empfohlene UD-IQ2_M (2-bit) Variante benötigt 239GB und passt auf einen 256GB Unified-Memory Mac oder ein System mit 1x24GB GPU + 256GB RAM (mit MoE-Offloading).
Quantisierung und Genauigkeit
Die dynamischen Quantisierungen überraschen mit ihrer Effizienz:
- 1-bit Dynamic: ~76.2% Top-1 Accuracy bei 86% Größenreduktion
- 2-bit Dynamic: ~82% Accuracy bei 84% Größenreduktion
Das bedeutet: Das Modell ist nicht 86% schlechter, sondern nur ~24% weniger akkurat als das volle 1.5TB Modell. Die 4-bit und 5-bit Varianten gelten als nahezu verlustfrei.
Installation mit Unsloth Studio
# MacOS, Linux, WSL
curl -fsSL https://unsloth.ai/install.sh | sh
# Windows PowerShell
irm https://unsloth.ai/install.ps1 | iex
# Starten
unsloth studio -H 0.0.0.0 -p 8888
Für sicheren HTTPS-Zugang über Cloudflare Tunnel:
unsloth studio --secure
Inference mit llama.cpp
Alternativ kann GLM-5.2 direkt mit llama.cpp betrieben werden:
# llama.cpp bauen
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
-DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first
# Modell herunterladen (2-bit)
hf download unsloth/GLM-5.2-GGUF \
--local-dir unsloth/GLM-5.2-GGUF \
--include "*UD-IQ2_M*"
# Ausführen
./llama.cpp/llama-cli \
--model unsloth/GLM-5.2-GGUF/UD-IQ2_M/GLM-5.2-UD-IQ2_M-00001-of-00006.gguf \
--temp 1.0 --top-p 0.95 --min-p 0.01
Thinking Modes
GLM-5.2 unterstützt drei Thinking-Modi:
- Non-Thinking: Für einfache Aufgaben
- High Thinking: Standard für komplexere Prompts
- Max Thinking: Für anspruchsvolle Reasoning-Aufgaben
In llama.cpp kann Thinking über --reasoning on/off oder --chat-template-kwargs '{"enable_thinking":false}' gesteuert werden.
Lange Kontexte mit KV-Cache-Quantisierung
Für den vollen 1M-Kontext ist KV-Cache-Quantisierung empfohlen:
./llama.cpp/llama-cli \
--model unsloth/GLM-5.2-GGUF/UD-IQ2_M/GLM-5.2-UD-IQ2_M-00001-of-00006.gguf \
--temp 1.0 --top-p 0.95 --min-p 0.01 \
--cache-type-k q4_1 \
--cache-type-v q4_1
Mit q4_1 erreichen Sie etwa 3.2x längere Kontexte bei minimalen Genauigkeitsverlusten.
Benchmarks im Vergleich
GLM-5.2 konkurriert mit den größten kommerziellen Modellen:
| Benchmark | GLM-5.2 | Claude 4.8 Opus | GPT-5.5 |
|---|---|---|---|
| HLE Reasoning | 40.5 | 49.8 | 41.4 |
| AIME 2026 | 99.2 | 95.7 | 98.3 |
| SWE-bench Pro | 62.1 | 69.2 | 58.6 |
| GPQA-Diamond | 91.2 | 93.6 | 93.6 |
Die vollständige Dokumentation finden Sie auf Unsloth.ai.