Article

Dual-GPU Setup: RTX 5080 + RTX 3090 für 80+ Tok/s auf Qwen 3.6

AI Hardware NVIDIA RTX Local LLM Qwen GPU

Das Setup

iMil zeigt, wie er eine RTX 5080 (16GB VRAM) mit einer refurbished RTX 3090 (24GB VRAM) kombiniert, um Qwen 3.6 27B Q8 mit über 80 Tok/s lokal laufen zu lassen.

Hardware

  • RTX 5080 – Gaming-Karte, 16GB VRAM
  • RTX 3090 – Refurbished, 24GB VRAM
  • Asus Prime X570-Pro – Wichtig: Die “Pro”-Version mit PCIe x16 → 2x8 Split

Warum dual GPU?

Das Problem mit 16GB

Qwen 3.5/3.6 braucht mehr als 16GB für brauchbare Quants:

  • Q4-Quants liefen mit MTP auf 50-60 Tok/s
  • Aber die 5080 wurde kaum genutzt

Die Lösung

Zwei GPUs mit unterschiedlichem VRAM kombinieren:

  • 40GB gesamt (16 + 24)
  • Ausreichend für Q8-Quants
  • Beide GPUs nutzen

BIOS-Setup

Wichtig: UEFI/BIOS-Mode

Du KANNST nicht im BIOS/MBR-Modus booten – das verhindert die Nutzung beider Karten.

Erforderliche Einstellungen

  1. Boot → CSM: Disabled
  2. Advanced → PCI Subsystem Settings:
    • Above 4G Decoding: Enabled
    • ReSize BAR Support: Auto oder Enabled
  3. Advanced → PCIEX16_1 Link Mode: Gen 4
  4. PCIEX16_2 Link Mode: Gen 4

Kernel-Treiber

Für gleiche GPU-Modelle

Wenn du zwei identische Karten hast:

  • Patched NVIDIA Open Kernel Modules nutzen
  • nvidia-dkms-open deinstallieren
  • nova-Treiber blacklisten

Für unterschiedliche Modelle (wie in diesem Fall)

Einfach den Standard-nvidia-open Treiber verwenden.

Die Ergebnisse

nvidia-smi Output

GPU 0: RTX 3090    24576MiB / 24576MiB
GPU 1: RTX 5080    16303MiB / 16303MiB

Performance

  • Qwen 3.6 27B Q8
  • 80+ Token/Sekunde
  • Beide GPUs arbeiten

Hardware-Tipps

Riser Cable

Die 5080 ist ein Monster – ein hochwertiges PCIe 4 Riser Cable für den zweiten Slot ist Pflicht.

Stromversorgung

  • RTX 3090: 350W TDP
  • RTX 5080: 360W TDP
  • Starkes Netzteil erforderlich (mindestens 850W, besser 1000W+)

Fazit

Lokale LLMs profitieren enorm von Dual-GPU-Setups:

  • VRAM ist King – mehr VRAM = größere Modelle / höhere Quants
  • Unterschiedliche Karten funktionieren – keine identischen GPUs nötig
  • PCIe 4.0 ist wichtig – Gen 3 bremst

Wer bereits eine 5080 hat, kann mit einer gebrauchten 3090 die Kapazität drastisch erhöhen – ohne teure Workstation-Hardware.


Links: iMil.net