Article

GLM-5.2 auf lokaler Hardware mit Unsloth

Tutorial LLM Local AI Unsloth GLM

GLM-5.2 ist Z.ai’s neuestes offenes Modell mit beeindruckenden Spezifikationen: 744 Milliarden Parameter, 40 Milliarden aktive Parameter und ein 1M Kontextfenster. Das Modell liefert SOTA-Performance in Coding, Reasoning und Agent-Tasks. Unsloth bietet nun Dynamic GGUF-Quantisierungen, die das Modell auf Consumer-Hardware zugänglich machen.

Hardware-Anforderungen

Die quantisierten Versionen benötigen deutlich weniger Speicher als das Original:

QuantisierungSpeicherbedarf
1-bit Dynamic223 GB
2-bit Dynamic245 GB
3-bit Dynamic290-360 GB
4-bit Dynamic372-475 GB
5-bit Dynamic570 GB
8-bit810 GB

Die empfohlene UD-IQ2_M (2-bit) Variante benötigt 239GB und passt auf einen 256GB Unified-Memory Mac oder ein System mit 1x24GB GPU + 256GB RAM (mit MoE-Offloading).

Quantisierung und Genauigkeit

Die dynamischen Quantisierungen überraschen mit ihrer Effizienz:

  • 1-bit Dynamic: ~76.2% Top-1 Accuracy bei 86% Größenreduktion
  • 2-bit Dynamic: ~82% Accuracy bei 84% Größenreduktion

Das bedeutet: Das Modell ist nicht 86% schlechter, sondern nur ~24% weniger akkurat als das volle 1.5TB Modell. Die 4-bit und 5-bit Varianten gelten als nahezu verlustfrei.

Installation mit Unsloth Studio

# MacOS, Linux, WSL
curl -fsSL https://unsloth.ai/install.sh | sh

# Windows PowerShell
irm https://unsloth.ai/install.ps1 | iex

# Starten
unsloth studio -H 0.0.0.0 -p 8888

Für sicheren HTTPS-Zugang über Cloudflare Tunnel:

unsloth studio --secure

Inference mit llama.cpp

Alternativ kann GLM-5.2 direkt mit llama.cpp betrieben werden:

# llama.cpp bauen
apt-get install pciutils build-essential cmake curl libcurl4-openssl-dev -y
git clone https://github.com/ggml-org/llama.cpp
cmake llama.cpp -B llama.cpp/build \
    -DBUILD_SHARED_LIBS=OFF -DGGML_CUDA=ON
cmake --build llama.cpp/build --config Release -j --clean-first

# Modell herunterladen (2-bit)
hf download unsloth/GLM-5.2-GGUF \
    --local-dir unsloth/GLM-5.2-GGUF \
    --include "*UD-IQ2_M*"

# Ausführen
./llama.cpp/llama-cli \
    --model unsloth/GLM-5.2-GGUF/UD-IQ2_M/GLM-5.2-UD-IQ2_M-00001-of-00006.gguf \
    --temp 1.0 --top-p 0.95 --min-p 0.01

Thinking Modes

GLM-5.2 unterstützt drei Thinking-Modi:

  • Non-Thinking: Für einfache Aufgaben
  • High Thinking: Standard für komplexere Prompts
  • Max Thinking: Für anspruchsvolle Reasoning-Aufgaben

In llama.cpp kann Thinking über --reasoning on/off oder --chat-template-kwargs '{"enable_thinking":false}' gesteuert werden.

Lange Kontexte mit KV-Cache-Quantisierung

Für den vollen 1M-Kontext ist KV-Cache-Quantisierung empfohlen:

./llama.cpp/llama-cli \
    --model unsloth/GLM-5.2-GGUF/UD-IQ2_M/GLM-5.2-UD-IQ2_M-00001-of-00006.gguf \
    --temp 1.0 --top-p 0.95 --min-p 0.01 \
    --cache-type-k q4_1 \
    --cache-type-v q4_1

Mit q4_1 erreichen Sie etwa 3.2x längere Kontexte bei minimalen Genauigkeitsverlusten.

Benchmarks im Vergleich

GLM-5.2 konkurriert mit den größten kommerziellen Modellen:

BenchmarkGLM-5.2Claude 4.8 OpusGPT-5.5
HLE Reasoning40.549.841.4
AIME 202699.295.798.3
SWE-bench Pro62.169.258.6
GPQA-Diamond91.293.693.6

Die vollständige Dokumentation finden Sie auf Unsloth.ai.