Article

Unsloth Dynamic 3.0 - Bessere Quantisierung bei gleicher Groesse

unsloth quantization gguf llama-cpp local-ai

Unsloth hat Dynamic v3.0 veroeffentlicht, die naechste Iteration seiner Dynamic-Quantisierungsmethode fuer GGUF-Modelle. Die ersten Quants fuer Qwen3.8-27B sind verfuegbar und liefern deutlich bessere Qualitaet bei gleicher Dateigroesse.

Was ist neu in Dynamic 3.0

Die wichtigste Neuerung: Dynamic v3.0 erreicht ueber 10% bessere Top-1% Accuracy bei gleicher Dateigroesse verglichen mit jedem anderen Anbieter. Die GGUFs funktionieren mit den gaengigen Inferenz-Engines inklusive llama.cpp und Unsloth Desktop.

Die Verbesserungen umfassen mehrere Bereiche:

  • Eine qualitativ hochwertigere imatrix-Kalibrierungs-Datensatz aus diversen Quellen
  • Raffiniert fuer agentic Coding, Chat und mehrsprachige Performance
  • Verbesserte Layer-Selection und zusaetzliche Quantisierungstechniken

KL Divergence als neuer Benchmark

Unsloth fuehrt einen neuen Metrik-Ansatz ein: Divergence-300 @32. Statt nur Top-1% Accuracy zu messen, wird ein Datensatz von 300 zurueckgehaltenen Beispielen mit Greedy Argmax-Decoding fuer 32 Tokens verglichen. Das ermoeglicht zu beurteilen, ob die Quantisierungs-Outputs aehnliche Trajektorien wie BF16-Modelle verfolgen - ein besseres Mass fuer tatsaechliche Inferenz-Qualitaet.

Kein Training, kein QAT

Wichtig: Unsloth trainiert nicht auf dem Kalibrierungs-Datensatz und verwendet kein QAT (Quantization-Aware Training) oder QAD. Alles passiert durch Post-Training Quantization. Die imatrix-Datei ist fuer die Community verfuegbar, um eigene Variationen und Fine-Tunes zu erstellen.

Verfuegbarkeit

In nur 5 Tagen verzeichnete Unsloth ueber 5,1 Millionen Qwen3.8-Downloads. Die Dynamic 3.0 GGUFs sind direkt verfuegbar und funktionieren mit llama.cpp - ideal fuer lokale Inferenz-Setups ohne Cloud-Abhaengigkeit.

Original-Quelle: unsloth.ai