Tools

WebLLM: Komplette LLM-Inferenz direkt im Browser mit WebGPU

webllm webgpu llm local-ai javascript

WebLLM ist eine Open-Source-Inferenz-Engine (rund 18.700 GitHub-Stars, Apache-2.0), die Sprachmodelle vollständig im Browser laufen lässt - mit WebGPU-Hardwarebeschleunigung und ganz ohne Backend-Server. Damit gehört das Projekt von MLC (CMU Catalyst) zur spannendsten Kategorie lokaler KI: Die Modelle laufen auf der GPU des Nutzers, Daten verlassen das Gerät nicht.

Was die Engine kann

  • Vollständige OpenAI-API-Kompatibilität: Streaming, JSON-Mode, Function-Calling und Logit-Kontrolle über die bekannte Schnittstelle
  • Native Unterstützung für Llama 3, Phi 3, Gemma, Mistral, Qwen und weitere Modellfamilien
  • Strukturierte JSON-Generierung mit Custom Schemas via WebAssembly
  • Web-Worker- und Service-Worker-Support, um UI-Thread und Modell-Lifecycle zu entkoppeln
  • Beispiele für Chrome-Extensions mit eingebauter KI

Aktuell ist Version 0.2.84 als npm-Paket (@mlc-ai/web-llm) verfügbar. In den Benchmarks des Projekts erreicht die Engine auf einem M3 Max rund 48 Token pro Sekunde beim Dekodieren eines 7B-Modells - flüssige Chat-Interaktion also auch ohne dedizierte Server-GPU.

Warum das relevant ist

Für Datenschutz-sensitive Anwendungen, Offline-Szenarien oder AI-Features ohne Infrastrukturkosten ist WebLLM ein echter Hebel. Die Demo WebLLM Chat zeigt, was geht; eigene Apps starten mit wenigen npm-Zeilen. Wer Ollama mag, bekommt hier das Äquivalent für den Browser.