Article
VibeThinker-3B: 3B-Modell schlägt Opus 4.5 im Reasoning
Ein chinesisches Forschungsteam hat mit VibeThinker-3B ein kompaktes Sprachmodell vorgestellt, das verblüffende Ergebnisse im Bereich des verifizierbaren Reasoning erzielt. Das Modell mit nur 3 Milliarden Parametern erreicht auf Benchmarks wie AIME26 einen Score von 94.3 (97.1 mit Test-Time-Scaling) und schlägt damit Flaggschiff-Modelle wie DeepSeek V3.2, GLM-5 und Gemini 3 Pro.
Trainingsansatz: Spectrum-to-Signal
Das Team nutzte einen optimierten Pipeline-Ansatz namens Spectrum-to-Signal, der drei Hauptkomponenten kombiniert:
- Curriculum-based Supervised Fine-Tuning: Strukturiertes Lernen mit zunehmender Komplexität
- Multi-Domain Reinforcement Learning: Verstärkungslernen über verschiedene Domänen hinweg
- Offline Self-Distillation: Komprimierung des Wissens in eine effizientere Form
Benchmark-Ergebnisse
Die Ergebnisse sind beeindruckend, besonders im Verhältnis zur Modellgröße:
| Benchmark | Score |
|---|---|
| AIME26 | 94.3 (97.1 mit Claim-Level Scaling) |
| LiveCodeBench v6 | 80.2 Pass@1 |
| LeetCode Contests (Unseen) | 96.1% Akzeptanzrate |
| IFEval | 93.4 |
Besonders bemerkenswert: Das Modell behält seine Instruktionskontrolle trotz der extremen Reasoning-Verbesserungen bei - ein häufiges Problem bei spezialisierten Reasoning-Modellen.
Parametric Compression-Coverage Hypothese
Die Forscher formulieren eine interessante These: Verifizierbares Reasoning lässt sich in kompakte “Reasoning Cores” komprimieren, während allgemeines Wissen und breite Kompetenz umfangreichere Parameterabdeckung benötigen. Dies erklärt, warum kleine Modelle in spezifischen Reasoning-Aufgaben mit riesigen Modellen konkurrieren können.
Bedeutung für die Community
VibeThinker-3B zeigt, dass spezialisierbares Training die Parameterlücke schließen kann. Für Entwickler bedeutet dies:
- Kompakte Modelle für Reasoning-Workloads wirtschaftlicher einsetzbar
- Weniger Rechenressourcen für vergleichbare Ergebnisse in bestimmten Domänen
- Neue Möglichkeiten für Edge-Deployment von High-Performance-Reasoning
Der technische Report ist auf arXiv verfügbar.