Models
Qwen3.8-Flash-Next: Architektur-Preview auf Qwen4 mit 125B Parametern
Das Qwen-Team hat mit Qwen3.8-Flash-Next die Gewichte eines neuen multimodalen MoE-Modells veroeffentlicht, das zugleich als frueher Architektur-Preview fuer Qwen4 dient. Aehnlich wie Qwen3-Next die Hybrid-Architektur fuer die Qwen3.5- bis 3.8-Serie vorstellte, previewt dieses Modell die kommenden Designs. Das Hauptmodell umfasst 125B Parameter mit zusaetzlichen 51B N-gram-Embeddings und aktiviert nur 6B Parameter pro Token. Gegenueber Qwen3.7-Plus sinkt der Trainingsaufwand auf etwa ein Neuntel, bei ueberlegener Leistung in Coding- und Office-Aufgaben.
Vier Architektur-Innovationen
- Attention: GDN + QSA Hybrid – Gated DeltaNet komprimiert Historie effizient, Qwen Sparse Attention nutzt Block-Level-Indexierung fuer preiswerte Long-Context-Retrieval
- Gated Residual (GR): Erweitert den Residual-Stream auf 4 Zweige mit dynamischem Gate, staerkt Cross-Layer-Informationfluss und Training-Stabilitaet; unterstuetzt FP8-Speicher
- N-gram Embedding: 51B zusaetzliche Parameter ueber Lookup-Tabellen, asynchron in Host-Memory ausgelagert, kaum zusaetzliche Compute-Kosten
- Muon Optimizer: Verfeinert fuer Orthogonalization-Genauigkeit, Aufteilung zwischen Muon und AdamW, mit angepasstem Scaling Law
Benchmark-Ergebnisse
- DeepSWE 1.1: 58.7 (vs. 16.5 Qwen3.7-Plus)
- SWE-bench Pro: 62.5 (vs. 55.8 Qwen3.7-Plus)
- CoWorkBench: 73.9 (vs. 65.1 Qwen3.7-Plus)
- JobBench: 55.7 (vs. 27.6 Qwen3.7-Plus)
- Toolathlon Verified: 73.5
- LiveCodeBench v6: 91.9
- GPQA Diamond: 91.7
- AndroidWorld: 84.5 (vs. 62.0 Claude-Opus-4.6)
- OSWorld 2.0: 19.4 Binary / 52.3 Partial
Effizienz und Kontext
- Native Kontextlaenge: 262.144 Token, erweiterbar auf 1.000.000 mit YaRN
- Prefill-Speedup bei 1M Token: QSA Attention Kernel bis zu 7.6x (Prefill), 4.9x (Decode)
- Throughput: 8.6x Prefill-Throughput gegenueber Qwen3.7-Plus bei 1M Token (90% Prefix-Cache-Hit-Rate)
- Base-Modell: 8 von 14 Benchmarks auf Platz 1 mit nur 6B aktivierten Parametern
Verfuegbarkeit und Preise
- Open Weights: HuggingFace und ModelScope
- Produktionsmodell: Qwen3.8-Flash auf QwenCloud mit 1M Kontext und integrierten Tools
- Preise: 0.16 USD pro Million Input-Token, 0.47 USD pro Million Output-Token
- API-Kompatibilitaet: OpenAI Chat Completions, Responses API, Anthropic-Interface
- Integrationen: Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw, QwenWork
Quelle: Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency