Article

ByteDance trainiert 10-Billionen-Parameter-Modell – Angriff auf Anthropic

AI ByteDance Anthropic LLM Training China

ByteDance, die Firma hinter TikTok, trainiert ein AI-Modell mit bis zu 10 Billionen (10 Trillionen) Parametern – dreimal größer als Moonshots Kimi K3, das bisher größte chinesische Modell. Damit zielt ByteDance direkt auf Anthropic ab, dessen Mythos 5 auf geschätzte 8 Billionen Parameter kommt.

Unabhängig statt distillieren

Interessant ist der Ansatz: ByteDance verweigert sich der üblichen “Distillation”-Strategie, bei der kleinere Modelle von größeren absaugen. Gründer Zhang Yiming sagte intern klipp und klar: Nur eigenständige Entwicklung führt zu Modellen, die Konkurrenten überholen. Das kostet Zeit – ByteDance war deshalb langsamer als Rivals –, aber Yiming sieht das langfristig.

Das Seed-Team

Das Model-Development-Team “Seed” hat ~2.000 Mitglieder, angeführt von Ex-Googler Wu Yonghui. Neben Researchern gibt’s eigene Data-Labeling-Teams, Infra-Engineers und Übersetzer. ByteDance investiert massiv in eigene Rechenzentren und plant sogar eigene AI-Chips.

Wo steht China?

Chinesische Labs holen schnell auf. Moonshot und Alibaba zeigen starke Benchmark-Ergebnisse und liegen nur hinter Anthropic’s Fable 5. ByteDance ist aktuell ambitioniertester Player – das 10T-Modell ist noch im Pre-Training, dauert typischerweise 3-6 Monate. Ob es tatsächlich bei 10B stehen bleibt, wird sich erst später zeigen.

Doubao, ByteDances Consumer-Modell, hat übrigens 324 Millionen monatliche Nutzer – allein in China. Das ist ein massives Vertriebsnetz für künftige Modell-Upgrades.