Tutorials
Lokale LLMs auf dem M4 Pro Mac mini: Ein praxistauglicher Stack
Kevin Lewis zeigt seinen kompletten lokalen LLM-Stack auf einem M4 Pro Mac mini mit 48 GB RAM - und das Setup dauert laut ihm rund 30 Minuten. Der Server bedient alles: den Hermes-Agent-Backend, schnelle Chat-Anfragen vom Handy und Coding-Tools. Die Bausteine:
- Qwen3.6-35B-A3B-OptiQ-4bit als Hauptmodell für Reasoning und Tiefe
- Gemma-4-E4B-it-OptiQ-4bit als Leichtgewicht für einfache Chats und Formatierung
- oMLX als Inference-Server
- Tailscale als privates Netz zwischen Mac mini, iPhone und MacBook
Warum überhaupt lokal?
Seine drei Hauptargumente: Cloud-APIs sind gepachtetes Land (Preise, Limits und Modellwechsel ohne Ankündigung), Datenschutz (einmal gesendete Daten sind unwiderruflich weg) und KI-Souveränität (Regierungen können Modell-Rollouts jederzeit einschränken). Dazu kommen flache Kosten nach dem Hardwarekauf, geringe Latenz, Offline-Fähigkeit und keine Rate Limits.
Der entscheidende Trick: MoE statt Dense
Der lehrreichste Teil des Artikels ist die RAM-Rechnung. Die Parameterkennung Qwen3.6-35B-A3B liest sich so:
- 35B: Parameter insgesamt (über 256 Experten verteilt)
- A3B: davon aktiv pro Token - nur 3 Milliarden
- OptiQ-4bit: gemischte 4-Bit-Quantisierung
Ein dichtes 27B-Modell hält alle 27 Milliarden Parameter für jedes Token in RAM - auf einem 16-GB-MacBook Air sind das ~14 GB, plus macOS-Overhead von 6-8 GB. Das Ergebnis: Swapping auf die SSD und Schmerz. Das MoE-Modell dagegen braucht bei 4 Bit rund 20 GB auf den 48 GB des Mac mini, fühlt sich beim Inferenzieren aber an wie ein 6B-Dense-Modell.
Die Praxis
Der Modellwechsel ist ein Download plus Neustart - oMLX erkennt neue Modelle im Verzeichnis automatisch, mit eingebautem HuggingFace-Browser. Der KV-Cache wird auf SSD persistiert, sodass Coding-Agents, die wieder in frühere Kontexte zurückspringen, ihn in Millisekunden vom Disk holen statt neu zu berechnen. Laut Lewis kostet die 4-Bit-Quantisierung nur 1-2 Benchmarkpunkte gegenüber BF16 - ein fairer Deal für 48 statt 70 GB RAM.
Das Fazit passt zur Stimmung der Szene: Lokale Modelle auf Apple Silicon sind kein Experiment mehr, sondern decken 80% des Alltags ab - kostenlos, ohne Rate Limits und ohne sensible Daten an Dritte.