Tutorials

Lokale LLMs auf dem M4 Pro Mac mini: Ein praxistauglicher Stack

local-llm apple-silicon omlx tailscale hermes

Kevin Lewis zeigt seinen kompletten lokalen LLM-Stack auf einem M4 Pro Mac mini mit 48 GB RAM - und das Setup dauert laut ihm rund 30 Minuten. Der Server bedient alles: den Hermes-Agent-Backend, schnelle Chat-Anfragen vom Handy und Coding-Tools. Die Bausteine:

  • Qwen3.6-35B-A3B-OptiQ-4bit als Hauptmodell für Reasoning und Tiefe
  • Gemma-4-E4B-it-OptiQ-4bit als Leichtgewicht für einfache Chats und Formatierung
  • oMLX als Inference-Server
  • Tailscale als privates Netz zwischen Mac mini, iPhone und MacBook

Warum überhaupt lokal?

Seine drei Hauptargumente: Cloud-APIs sind gepachtetes Land (Preise, Limits und Modellwechsel ohne Ankündigung), Datenschutz (einmal gesendete Daten sind unwiderruflich weg) und KI-Souveränität (Regierungen können Modell-Rollouts jederzeit einschränken). Dazu kommen flache Kosten nach dem Hardwarekauf, geringe Latenz, Offline-Fähigkeit und keine Rate Limits.

Der entscheidende Trick: MoE statt Dense

Der lehrreichste Teil des Artikels ist die RAM-Rechnung. Die Parameterkennung Qwen3.6-35B-A3B liest sich so:

  • 35B: Parameter insgesamt (über 256 Experten verteilt)
  • A3B: davon aktiv pro Token - nur 3 Milliarden
  • OptiQ-4bit: gemischte 4-Bit-Quantisierung

Ein dichtes 27B-Modell hält alle 27 Milliarden Parameter für jedes Token in RAM - auf einem 16-GB-MacBook Air sind das ~14 GB, plus macOS-Overhead von 6-8 GB. Das Ergebnis: Swapping auf die SSD und Schmerz. Das MoE-Modell dagegen braucht bei 4 Bit rund 20 GB auf den 48 GB des Mac mini, fühlt sich beim Inferenzieren aber an wie ein 6B-Dense-Modell.

Die Praxis

Der Modellwechsel ist ein Download plus Neustart - oMLX erkennt neue Modelle im Verzeichnis automatisch, mit eingebautem HuggingFace-Browser. Der KV-Cache wird auf SSD persistiert, sodass Coding-Agents, die wieder in frühere Kontexte zurückspringen, ihn in Millisekunden vom Disk holen statt neu zu berechnen. Laut Lewis kostet die 4-Bit-Quantisierung nur 1-2 Benchmarkpunkte gegenüber BF16 - ein fairer Deal für 48 statt 70 GB RAM.

Das Fazit passt zur Stimmung der Szene: Lokale Modelle auf Apple Silicon sind kein Experiment mehr, sondern decken 80% des Alltags ab - kostenlos, ohne Rate Limits und ohne sensible Daten an Dritte.

Link: My local model setup on an M4 Pro Mac mini