Article
Umfassender Guide: SOTA LLMs lokal betreiben – von $2k bis $40k
Das Problem
Wer LLMs lokal betreiben will, steht vor einer Flut von Hardware-Entscheidungen. Dario Amodei (Anthropic) und Sam Altman (OpenAI) machen mit ihren Cloud-Modellen Druck – aber lokale Inferenz bietet Privatsphäre, Kostensicherheit und Unabhängigkeit.
Jamesob’s GitHub-Repo local-llm ist ein praktischer Leitfaden für den Bau eigener LLM-Workstation – von Budget bis High-End.
Die Preisoptionen
Einstieg: ~$2.000
48GB VRAM mit 2x RTX 3090:
- Läuft Qwen3.6-27B – ein hervorragendes Modell
- Whisper-large-v3 für Speech-to-Text
- Bereits sehr nützlich für die meisten Aufgaben
High-End: ~$40.000
384GB VRAM mit 4x RTX Pro 6000 Blackwell:
- Ermöglicht Modelle nahe Claude Opus-Niveau
- Aktuelles Top-Modell: GLM-5.2-Int8Mix-NVFP4-REAP-594B
- ~80 Token/Sekunde @ 240k Kontext
Die Hardware-Details
Base System (~$5.600)
| Komponente | Spec | Preis |
|---|---|---|
| Motherboard | ASRock Rack ROMED8-2T (SP3, 7× PCIe 4.0 x16) | $715 |
| CPU | AMD EPYC Milan 7313P (16-core 3.0GHz) | $504 |
| RAM | 8× 16GB DDR4 ECC (128GB, eBay) | $642 |
| PCIe Switch | c-payne Microchip Switchtec PM40100 Gen4 | ~$1.330 |
| Storage | 4TB Boot + 2× 8TB NVMe (Model Weights) | $1.491 |
| PSUs | 2× Super Flower 1700W | $750 |
| Total | $5.587 |
GPUs (~$46.000)
4× NVIDIA RTX PRO 6000 Blackwell Workstation – je 96GB VRAM = 384GB total.
Der PCIe-Switch-Trick
Der Clou: Ein PCIe Gen4 Switch erlaubt GPUs, direkt peer-to-peer zu kommunizieren:
- 27.5 GB/s unidirektional / 50.4 GB/s bidirektional
- 0.37–0.45 µs Latenz
- Vermeidet Umweg über CPU-Root-Complex
Wichtige BIOS-Settings
| Setting | Value | Grund |
|---|---|---|
| PCIe Link Width | x16 (nicht x8/x8) | Bifurcation deaktivieren |
| PCIe Link Speed | Gen4 (nicht Auto) | Gen5-GPUs fallen sonst auf Gen1 |
| ASPM | Disabled | Verhindert Gen1-Downgrade-Scare |
| Re-Size BAR | Enabled | Full 96GB VRAM BAR |
| SR-IOV | Disabled | Bare-metal für P2P |
Kernel-Parameter
# /etc/default/grub
GRUB_CMDLINE_LINUX="iommu=off amd_iommu=off nomodeset"
# nvidia_uvm P2P fix
echo 'options nvidia_uvm uvm_disable_hmm=1' | sudo tee /etc/modprobe.d/uvm.conf
Ohne iommu=off hängt NCCL bei Multi-GPU P2P!
ACS Disable (kritisch für Switch P2P)
Standardmäßig leitet ACS P2P-Traffic über die CPU – negiert den Switch. Ein Runtime-Script deaktiviert ACS:
#!/bin/bash
for BDF in $(lspci -d "*:*:*" | awk '{print $1}'); do
setpci -s ${BDF} ECAP_ACS+0x6.w > /dev/null 2>&1
if [ 0 -eq 0 ]; then
setpci -s ${BDF} ECAP_ACS+0x6.w=0000
fi
done
Power Management
110V Circuit Constraint: 350W/GPU statt 600W Default = 1.400W GPU-Load.
sudo nvidia-smi -pm 1 # Persistence mode
sudo nvidia-smi -pl 350 # Power cap
Modelle laufen lassen
Model-Download
hf download <model-name> --local-dir ~/storage/<model-name>
Runner-Configs
Im runners/-Verzeichnis finden sich Docker-Compose-Configs für:
- GLM-5.2-594B: vLLM Config für 4× RTX6kPRO
- Whisper-large-v3: Speech-to-Text mit <11GB VRAM
Fazit
Der Guide zeigt: Lokale LLMs sind machbar – wenn man die Hardware richtig konfiguriert. Der PCIe-Switch ist der Gamechanger für Multi-GPU-Setups, und die bereitgestellten Configs sparen Tage an Debugging-Zeit.