Models
Qwen3.8-2.4T-A95B: Massive MoE mit 2,4 Billionen Parametern eroeffnet offene Max-Klasse
Mit Qwen3.8-2.4T-A95B veröffentlicht das Qwen-Team erstmals ein Modell der sogenannten Max-Klasse als offene Gewichte. Das Mixture-of-Experts-Modell vereint 2,4 Billionen (2,4T) Gesamtparameter, von denen pro Token nur 95 Milliarden aktiviert werden — ein Sparsamkeitsgrad, der Inferenzkosten gegenüber einem vergleichbaren Dense-Modell drastisch senkt. Architekturell baut Qwen3.8 auf dem Fundament der Qwen3.5-Serie auf und kombiniert erstmals in dieser Familie hybride Aufmerksamkeit: Ein Layout aus 92 Schichten in 23 Blöcken wechselt jeweils drei Gated-DeltaNet-Layer (lineare Aufmerksamkeit mit 128 V- und 16 QK-Kopfpaaren) mit einer Gated-Attention-Layer (64 Q-, 4 KV-Kopfpaare, RoPE-Dimension 64) ab. Die Experten-Schicht umfasst 512 Experten mit Intermediate-Dimension 2048, von denen 10 routete plus ein gemeinsamer Experte pro Token feuern.
Weitere bemerkenswerte Eigenschaften: Die Hidden-Dimension beträgt 8192, das Vokabular ist auf 248.320 Tokens gepaddet, und Multi-Token-Prediction wurde während des Trainings eingesetzt. Der Kontext beträgt nativ 262.144 Tokens und ist bis auf über eine Million erweiterbar. Bemerkenswert ist zudem, dass das Modell text-only ist und zwingend im Thinking-Modus läuft — Denken lässt sich nicht abschalten. Über den Parameter reasoning_effort lässt sich die Tiefe der Schlussfolgerungen in drei Stufen steuern. In Benchmarks wie PaperBench (93,0), FrontierSWE (73,5) und SWE-bench Pro (67,7) zeigt Qwen3.8-Max — die offizielle Managed-Variante mit Vision-Input und 1-Million-Kontext — gegenüber Konkurrenten wie Opus 4.8 und GPT-5.6 erhebliche Fortschritte. Die Gewichte sind mit vLLM, SGLang und TokenSpeed kompatibel und stehen unter der Lizenz “qwen3.8-max”.