Article
LongCat-2.0: 1.6T MoE-Modell mit 48B Active Parameters
LongCat-2.0 ist ein neues Mixture-of-Experts (MoE) Modell mit 1.6 Billionen Total Parametern und 48 Milliarden Active Parameters. Besonders: Die Architektur ist auf 1M-Token-Context optimiert und läuft auf AI-ASIC-Superpods statt klassischen GPUs.
Architektur-Highlights:
- LongCat Sparse Attention (LSA) – Drei orthogonale Effizienz-Verbesserungen zum Lightning Indexer in DSA: Cross-Layer Indexing (ein Indexing-Pass dient mehrere aufeinanderfolgende Layer), kontinuierliche Index-Ausgabe, und quadratische Scoring-Kosten-Reduktion
- N-gram Embedding – Für effiziente Tokenisierung längerer Sequenzen
- MTP Module – Multi-Token Prediction für beschleunigte Speculative Decoding
Training auf AI-ASICs: Die Accelerators haben signifikant weniger Memory pro Device als H800 (80GB), Memory wird zum primären Bottleneck. Parallel Strategy und Memory Management sind die Haupt-Optimierungsdimensionen.
Benchmarks (Terminal-Bench 2.1: 70.8, SWE-bench Pro: 59.5, FORTE: 73.2) zeigen konkurrenzfähige Performance gegen Gemini 3.1 Pro und GPT-5.5.
Die Model-Weight-Downloads sind auf der LongCat-Website verfügbar. Ein interessanter Ansatz für Long-Context-Anwendungen, der weg von Nvidia-H100/H800 hin zu spezialisierten AI-ASICs zeigt.