Models
Needle 2: 14 MB kleines LLM fuer Smartphones, Wearables und Smart Home
Needle 2: Agentic LLM mit 45M Parametern in 14 MB
Cactus Compute hat Needle 2 veroeffentlicht — ein offenes 45-Millionen-Parameter-Modell, das als komplettes Binary gerade einmal 14 MB gross ist. Das Modell ist spezialisiert auf Tool-Calling, Geraetesteuerung und strukturierte Datenextraktion. Eine komplette Session benoetigt nur 28 MB RAM. Es laeuft direkt auf Smartphones, Wearables, Raspberry Pis und sogar Mikrocontrollern wie dem ESP32-S3.
Performance und Benchmarks
- 500 Token/Sekunde Decode-Speed auf einem Raspberry Pi 5
- 400-1.500 Token/Sekunde auf VR-Geraeten wie Meta Quest 3S und Apple Vision Pro
- 300-700 Token/Sekunde auf Sub-200-Dollar-Smartphones (Samsung A-Serie)
- Konkurrenzfaehig mit FunctionGemma 270M, LFM2.5 230M und Apple FM — bei 5x bis 70x geringerer Groesse
Architektur und Quantisierung
Needle 2 basiert auf dem Simple Attention Network und verwendet CQ2-bit-Quantisierung — entwickelt durch Cactus Quants. Der Trick: Das Modell wird von Grund auf mit 2-bit-Quantisierung trainiert, nicht nachtraeglich quantisiert. Dadurch gehen keine Qualitaetsverluste entstehen. Das gesamte Modell (Gewichte, Tokenizer, Grammar Compiler) ist in einem einzigen C++-Binary ohne Abhaengigkeiten verpackt, das von Cortex-M ueber x86 bis WebAssembly laeuft.
Praxis-Einsatz
Pebble — der Pionier moderner Wearables — setzt Needle 2 bereits in der Index 01-App ein. Der Pebble Index Ring hat keinen Bildschirm; gesprochene Befehle muessen lokal und ohne Internet-Verbindung in Aktionen umgewandelt werden. Needle uebernimmt genau diese Uebersetzung von natuerlicher Sprache in typisierte Funktionsaufrufe.
Entwickler-Relevanz
Das Modell steht unter Apache 2.0 mit Gewichten auf HuggingFace. Fine-Tuning ist auf einem normalen Mac oder PC in Minuten bis wenigen Stunden moeglich — bei 45M Parametern ist das Modell klein genug, um dort zu trainieren, wo es laeuft. Ideal fuer Produkte mit eigener Tool-Vokabular, die keine Cloud-Anbindung benoetigen.