Article

Swiftlet: 80B-Qwen-Modell mit nur 4,3 GB RAM auf Mac und iPhone

AI LLM Qwen Local Inference Apple MoE Quantisierung

Swiftlet ist eine in Swift und Metal geschriebene Runtime, die Qwen3-Next-80B- und Qwen3.6-35B-MoE-Modelle direkt auf Apple-Geräten ausführt – inklusive iPhone. Der Schlüssel: Expert Streaming. Da diese Modelle pro Token nur rund 3B Parameter aktivieren (10 von 512 Experten beim 80B, 8 von 256 beim 35B), hält Swiftlet lediglich den dichten Kern – Attention, Router, Embeddings – im RAM (ca. 2,5 GB beim 80B in 4-bit). Die Expertengewichte werden bei Bedarf per pread direkt von der SSD gestreamt, in einem begrenzten Cache-Pool mit LFU-plus-Recency-Eviction gehalten.

75 % der Schichten nutzen Gated-DeltaNet-Linear-Attention mit fixem Rekurrenz-Zustand – kein wachsender KV-Cache. Die Quantisierung erfolgt als MLX-affine int4/int8-Gruppenquantisierung; Shader werden zur Laufzeit kompiliert. Auf einem M5-Mac erreicht das 80B-Modell 4,5–5 Token/s bei 4,3 GB Spitzen-RAM (42 GB auf SSD), das 35B-Modell 7–11 Token/s bei 2,6 GB. Das 35B läuft zudem nativ auf dem iPhone 17 mit ~2,5 GB RAM und rund 1 Token/s – wohl das erste Mal, dass ein Modell dieser Größenklasse auf einem Telefon läuft. Swiftlet ist Open Source (Apache 2.0).

Link: Swiftlet auf GitHub