Models

Qwen3.8-Flash-Next: Architektur-Preview auf Qwen4 mit 125B Parametern

ai models llm

Das Qwen-Team hat mit Qwen3.8-Flash-Next die Gewichte eines neuen multimodalen MoE-Modells veroeffentlicht, das zugleich als frueher Architektur-Preview fuer Qwen4 dient. Aehnlich wie Qwen3-Next die Hybrid-Architektur fuer die Qwen3.5- bis 3.8-Serie vorstellte, previewt dieses Modell die kommenden Designs. Das Hauptmodell umfasst 125B Parameter mit zusaetzlichen 51B N-gram-Embeddings und aktiviert nur 6B Parameter pro Token. Gegenueber Qwen3.7-Plus sinkt der Trainingsaufwand auf etwa ein Neuntel, bei ueberlegener Leistung in Coding- und Office-Aufgaben.

Vier Architektur-Innovationen

  • Attention: GDN + QSA Hybrid – Gated DeltaNet komprimiert Historie effizient, Qwen Sparse Attention nutzt Block-Level-Indexierung fuer preiswerte Long-Context-Retrieval
  • Gated Residual (GR): Erweitert den Residual-Stream auf 4 Zweige mit dynamischem Gate, staerkt Cross-Layer-Informationfluss und Training-Stabilitaet; unterstuetzt FP8-Speicher
  • N-gram Embedding: 51B zusaetzliche Parameter ueber Lookup-Tabellen, asynchron in Host-Memory ausgelagert, kaum zusaetzliche Compute-Kosten
  • Muon Optimizer: Verfeinert fuer Orthogonalization-Genauigkeit, Aufteilung zwischen Muon und AdamW, mit angepasstem Scaling Law

Benchmark-Ergebnisse

  • DeepSWE 1.1: 58.7 (vs. 16.5 Qwen3.7-Plus)
  • SWE-bench Pro: 62.5 (vs. 55.8 Qwen3.7-Plus)
  • CoWorkBench: 73.9 (vs. 65.1 Qwen3.7-Plus)
  • JobBench: 55.7 (vs. 27.6 Qwen3.7-Plus)
  • Toolathlon Verified: 73.5
  • LiveCodeBench v6: 91.9
  • GPQA Diamond: 91.7
  • AndroidWorld: 84.5 (vs. 62.0 Claude-Opus-4.6)
  • OSWorld 2.0: 19.4 Binary / 52.3 Partial

Effizienz und Kontext

  • Native Kontextlaenge: 262.144 Token, erweiterbar auf 1.000.000 mit YaRN
  • Prefill-Speedup bei 1M Token: QSA Attention Kernel bis zu 7.6x (Prefill), 4.9x (Decode)
  • Throughput: 8.6x Prefill-Throughput gegenueber Qwen3.7-Plus bei 1M Token (90% Prefix-Cache-Hit-Rate)
  • Base-Modell: 8 von 14 Benchmarks auf Platz 1 mit nur 6B aktivierten Parametern

Verfuegbarkeit und Preise

  • Open Weights: HuggingFace und ModelScope
  • Produktionsmodell: Qwen3.8-Flash auf QwenCloud mit 1M Kontext und integrierten Tools
  • Preise: 0.16 USD pro Million Input-Token, 0.47 USD pro Million Output-Token
  • API-Kompatibilitaet: OpenAI Chat Completions, Responses API, Anthropic-Interface
  • Integrationen: Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw, QwenWork

Quelle: Qwen3.8-Flash-Next: A New Architecture, Towards Ultimate Cost-Efficiency