Article
Cloudflare: Kleinere, schnellere, sicherere Modelle mit Kimi und GLM at Scale
Cloudflare beschreibt in seinem Beitrag, wie das Unternehmen zwei besonders ressourcenintensive Open-Source-Modelle — Moonshots Kimi K2.6 und Z.ais GLM 5.2, beides Mixture-of-Experts-Modelle mit langem Kontextfenster — auf seiner Workers-AI-Plattform effizient bereitstellt. Als Grundlage dient das Open-Source-Inferenz-Framework SGLang.
Drei zentrale Optimierungstechniken kommen zum Einsatz: Erstens wird der KV-Cache von BF16 auf FP8 quantisiert, was den Speicherbedarf halbiert und den maximalen Kontext von rund 686.000 auf etwa 1,37 Millionen Token verdoppelt. Zweitens werden die Modellgewichte von FP8 auf INT4 komprimiert, wodurch der GLM-Checkpoint von 705 GB auf 421 GB schrumpft und die Decode-Geschwindigkeit bei niedriger Nebenläufigkeit um bis zu 55 % steigt. Drittens implementiert Cloudflare eine KV-Cache-Integritätsprüfung, die verhindert, dass bei gemeinsam genutztem Speicher falsche Cache-Seiten ausgelesen werden — bei einem Overhead von unter 1 %.
Entscheidend: In allen Benchmarks (GSM8K, MMLU, ARC) bleiben Genauigkeit und Tool-Call-Validität praktisch identisch. Die Kombination aus FP8-Prefill und INT4-Decode in einer disaggregierten Architektur liefert höhere Durchsätze, niedrigere Kosten pro Token und mehr Sicherheit — ohne Qualitätsverluste.