Article

VibeThinker-3B: 3B-Modell schlägt Opus 4.5 im Reasoning

AI LLM Reasoning Open Source

Ein chinesisches Forschungsteam hat mit VibeThinker-3B ein kompaktes Sprachmodell vorgestellt, das verblüffende Ergebnisse im Bereich des verifizierbaren Reasoning erzielt. Das Modell mit nur 3 Milliarden Parametern erreicht auf Benchmarks wie AIME26 einen Score von 94.3 (97.1 mit Test-Time-Scaling) und schlägt damit Flaggschiff-Modelle wie DeepSeek V3.2, GLM-5 und Gemini 3 Pro.

Trainingsansatz: Spectrum-to-Signal

Das Team nutzte einen optimierten Pipeline-Ansatz namens Spectrum-to-Signal, der drei Hauptkomponenten kombiniert:

  • Curriculum-based Supervised Fine-Tuning: Strukturiertes Lernen mit zunehmender Komplexität
  • Multi-Domain Reinforcement Learning: Verstärkungslernen über verschiedene Domänen hinweg
  • Offline Self-Distillation: Komprimierung des Wissens in eine effizientere Form

Benchmark-Ergebnisse

Die Ergebnisse sind beeindruckend, besonders im Verhältnis zur Modellgröße:

BenchmarkScore
AIME2694.3 (97.1 mit Claim-Level Scaling)
LiveCodeBench v680.2 Pass@1
LeetCode Contests (Unseen)96.1% Akzeptanzrate
IFEval93.4

Besonders bemerkenswert: Das Modell behält seine Instruktionskontrolle trotz der extremen Reasoning-Verbesserungen bei - ein häufiges Problem bei spezialisierten Reasoning-Modellen.

Parametric Compression-Coverage Hypothese

Die Forscher formulieren eine interessante These: Verifizierbares Reasoning lässt sich in kompakte “Reasoning Cores” komprimieren, während allgemeines Wissen und breite Kompetenz umfangreichere Parameterabdeckung benötigen. Dies erklärt, warum kleine Modelle in spezifischen Reasoning-Aufgaben mit riesigen Modellen konkurrieren können.

Bedeutung für die Community

VibeThinker-3B zeigt, dass spezialisierbares Training die Parameterlücke schließen kann. Für Entwickler bedeutet dies:

  • Kompakte Modelle für Reasoning-Workloads wirtschaftlicher einsetzbar
  • Weniger Rechenressourcen für vergleichbare Ergebnisse in bestimmten Domänen
  • Neue Möglichkeiten für Edge-Deployment von High-Performance-Reasoning

Der technische Report ist auf arXiv verfügbar.