Models

Quantisierung als Chance: 4-Bit-Modell schlaegt sein Original

quantization compression llm optimization

Das paradoxe Ergebnis

Multiverse Computing zeigt mit Quantization-Aware Healing (QAH) etwas, das eigentlich nicht passieren sollte: Ein 4-bit-quantisiertes Modell ist besser als sein eigenes 16-bit-Original. Konkret wurde ein GPT-OSS 120B auf 60B Parameter komprimiert, in MXFP4 quantisiert und per QAH behandelt. Das Ergebnis schlägt das bfloat16-Vorbild in 7 von 9 Benchmarks — bei einem Bruchteil des Speichers und Compute-Bedarfs.

Warum bisherige Healing-Methoden scheitern

  • QAT (Quantization-Aware Training): Teuer, instabil — läuft aus dem Ruder, wenn man zu lange trainiert. Braucht careful early stopping.
  • QAD (Quantization-Aware Distillation): Setzt ein vollpräzises Teacher-Modell voraus. Nach struktureller Kompression gibt es das aber nicht mehr — der recoverte bfloat16-Checkpoint selbst ist nur eine Approximation und deckelt die Genauigkeit.

Der QAH-Trick

QAH distilliert direkt vom ursprünglichen Pre-Compression-Modell, nicht vom recoverten Zwischending. Teacher (120B, vollpräzise) und Student (60B, 4-bit) teilen nicht mal die Architektur. Über KL-Divergenz auf den Logits überträgt der Teacher seine Output-Verteilung — architecture-agnostic, kein Problem. Das 4-bit-Modell kriegt dabei Supervision, die das bfloat16-Modell nie bekommen hat. Nice Side-Effekt: KL gegen einen frozen Teacher bedeutet, sobald der Student aufholt, driftet er nicht weiter weg. QAT bricht dagegen ein.

Benchmark-Highlights

  • AA-LCR (Long-Context Reasoning): +7.4 Punkte vs. bfloat16
  • AIME 2025 (Math): +5.6 Punkte
  • LiveCodeBench: Schlägt sogar den 120B-Teacher (66.5 vs. 66.0)
  • Trainingsgeschwindigkeit: Peak in ~100 Steps vs. ~700 bei QAT — ca. 7x schneller

Praktische Bedeutung

4x weniger Weight-Memory, halbe Parameter, stabileres Training, bessere Accuracy. Quantisierung ist hier kein Steuer mehr, den man für Effizienz zahlt — es ist eine zusätzliche Lerngelegenheit. Das ändert die Deploy-Story für komprimierte LLMs erheblich.

Originalquelle: Quantization-Aware Healing: a compressed, 4-bit model that outperforms its full-precision original