Article
Moebius: 0.2B Image Inpainting mit 10B-Level Performance
Chinesische Forscher stellen Moebius vor: Ein Bild-Inpainting-Modell mit nur 226M Parametern, das mit 10B-Modellen wie FLUX.1-Fill-Dev konkurriert.
Das Team von HUSTVL (Huazhong University) beweist, dass Task-spezifische Modelle effizienter sein können als generalistische Riesen. Die Eckdaten:
Performance & Effizienz:
- Nur 226M Parameter (< 2% von FLUX.1-Fill-Dev’s 11.9B)
- 15× schneller mit 26ms pro Schritt auf einer GPU
- Parität oder bessere Qualität als 10B-Modelle auf 6 Benchmarks
Technische Innovationen:
- LλMI Block: Kondensiert räumlichen Kontext und semantische Priors in lineare Matrizen - umgeht quadratische Komplexität
- Adaptive Multi-Granularity Distillation: Transfer von Repräsentationskapazität vom Teacher-Modell PixelHacker
- Optimale Architektur-Distillation Balance: Systematische Erforschung der Synergie zwischen kompaktem Design und Knowledge Transfer
Benchmarks: Getestet auf Places2 (Naturszenen) und CelebA-HQ/FFHQ (Portraits). Moebius erreicht besonders starke Ergebnisse bei komplexen Texturen und Gesichtsplausibilität.
Die Botschaft ist klar: Nicht immer nur skalieren. Ein spezialisierter Experte kann leichter, schneller und genauso gut sein wie ein aufgebläheter Generalist. Perfekt für Consumer-Hardware und Edge-Devices.