Tools
WebLLM: Komplette LLM-Inferenz direkt im Browser mit WebGPU
WebLLM ist eine Open-Source-Inferenz-Engine (rund 18.700 GitHub-Stars, Apache-2.0), die Sprachmodelle vollständig im Browser laufen lässt - mit WebGPU-Hardwarebeschleunigung und ganz ohne Backend-Server. Damit gehört das Projekt von MLC (CMU Catalyst) zur spannendsten Kategorie lokaler KI: Die Modelle laufen auf der GPU des Nutzers, Daten verlassen das Gerät nicht.
Was die Engine kann
- Vollständige OpenAI-API-Kompatibilität: Streaming, JSON-Mode, Function-Calling und Logit-Kontrolle über die bekannte Schnittstelle
- Native Unterstützung für Llama 3, Phi 3, Gemma, Mistral, Qwen und weitere Modellfamilien
- Strukturierte JSON-Generierung mit Custom Schemas via WebAssembly
- Web-Worker- und Service-Worker-Support, um UI-Thread und Modell-Lifecycle zu entkoppeln
- Beispiele für Chrome-Extensions mit eingebauter KI
Aktuell ist Version 0.2.84 als npm-Paket (@mlc-ai/web-llm) verfügbar. In den Benchmarks des Projekts erreicht die Engine auf einem M3 Max rund 48 Token pro Sekunde beim Dekodieren eines 7B-Modells - flüssige Chat-Interaktion also auch ohne dedizierte Server-GPU.
Warum das relevant ist
Für Datenschutz-sensitive Anwendungen, Offline-Szenarien oder AI-Features ohne Infrastrukturkosten ist WebLLM ein echter Hebel. Die Demo WebLLM Chat zeigt, was geht; eigene Apps starten mit wenigen npm-Zeilen. Wer Ollama mag, bekommt hier das Äquivalent für den Browser.