Article

Umfassender Guide: SOTA LLMs lokal betreiben – von $2k bis $40k

LLM Local Inference Hardware RTX 6000 Pro vLLM GLM-5 Speech-to-Text

Das Problem

Wer LLMs lokal betreiben will, steht vor einer Flut von Hardware-Entscheidungen. Dario Amodei (Anthropic) und Sam Altman (OpenAI) machen mit ihren Cloud-Modellen Druck – aber lokale Inferenz bietet Privatsphäre, Kostensicherheit und Unabhängigkeit.

Jamesob’s GitHub-Repo local-llm ist ein praktischer Leitfaden für den Bau eigener LLM-Workstation – von Budget bis High-End.

Die Preisoptionen

Einstieg: ~$2.000

48GB VRAM mit 2x RTX 3090:

  • Läuft Qwen3.6-27B – ein hervorragendes Modell
  • Whisper-large-v3 für Speech-to-Text
  • Bereits sehr nützlich für die meisten Aufgaben

High-End: ~$40.000

384GB VRAM mit 4x RTX Pro 6000 Blackwell:

  • Ermöglicht Modelle nahe Claude Opus-Niveau
  • Aktuelles Top-Modell: GLM-5.2-Int8Mix-NVFP4-REAP-594B
  • ~80 Token/Sekunde @ 240k Kontext

Die Hardware-Details

Base System (~$5.600)

KomponenteSpecPreis
MotherboardASRock Rack ROMED8-2T (SP3, 7× PCIe 4.0 x16)$715
CPUAMD EPYC Milan 7313P (16-core 3.0GHz)$504
RAM8× 16GB DDR4 ECC (128GB, eBay)$642
PCIe Switchc-payne Microchip Switchtec PM40100 Gen4~$1.330
Storage4TB Boot + 2× 8TB NVMe (Model Weights)$1.491
PSUs2× Super Flower 1700W$750
Total$5.587

GPUs (~$46.000)

4× NVIDIA RTX PRO 6000 Blackwell Workstation – je 96GB VRAM = 384GB total.

Der PCIe-Switch-Trick

Der Clou: Ein PCIe Gen4 Switch erlaubt GPUs, direkt peer-to-peer zu kommunizieren:

  • 27.5 GB/s unidirektional / 50.4 GB/s bidirektional
  • 0.37–0.45 µs Latenz
  • Vermeidet Umweg über CPU-Root-Complex

Wichtige BIOS-Settings

SettingValueGrund
PCIe Link Widthx16 (nicht x8/x8)Bifurcation deaktivieren
PCIe Link SpeedGen4 (nicht Auto)Gen5-GPUs fallen sonst auf Gen1
ASPMDisabledVerhindert Gen1-Downgrade-Scare
Re-Size BAREnabledFull 96GB VRAM BAR
SR-IOVDisabledBare-metal für P2P

Kernel-Parameter

# /etc/default/grub
GRUB_CMDLINE_LINUX="iommu=off amd_iommu=off nomodeset"

# nvidia_uvm P2P fix
echo 'options nvidia_uvm uvm_disable_hmm=1' | sudo tee /etc/modprobe.d/uvm.conf

Ohne iommu=off hängt NCCL bei Multi-GPU P2P!

ACS Disable (kritisch für Switch P2P)

Standardmäßig leitet ACS P2P-Traffic über die CPU – negiert den Switch. Ein Runtime-Script deaktiviert ACS:

#!/bin/bash
for BDF in $(lspci -d "*:*:*" | awk '{print $1}'); do
  setpci -s ${BDF} ECAP_ACS+0x6.w > /dev/null 2>&1
  if [ 0 -eq 0 ]; then
    setpci -s ${BDF} ECAP_ACS+0x6.w=0000
  fi
done

Power Management

110V Circuit Constraint: 350W/GPU statt 600W Default = 1.400W GPU-Load.

sudo nvidia-smi -pm 1        # Persistence mode
sudo nvidia-smi -pl 350      # Power cap

Modelle laufen lassen

Model-Download

hf download <model-name> --local-dir ~/storage/<model-name>

Runner-Configs

Im runners/-Verzeichnis finden sich Docker-Compose-Configs für:

  • GLM-5.2-594B: vLLM Config für 4× RTX6kPRO
  • Whisper-large-v3: Speech-to-Text mit <11GB VRAM

Fazit

Der Guide zeigt: Lokale LLMs sind machbar – wenn man die Hardware richtig konfiguriert. Der PCIe-Switch ist der Gamechanger für Multi-GPU-Setups, und die bereitgestellten Configs sparen Tage an Debugging-Zeit.

Link: github.com/jamesob/local-llm