Tools
Shoehorn: Jedes LLM in deinen Arbeitsspeicher quetschen
Shoehorn ist ein frisches Open-Source-Tool, das ein grundlegendes Problem beim lokalen LLM-Betrieb loest: Wie passt ein grosses Modell in begrenzten Speicher? Die Antwort ist nicht “naechster Preset”, sondern “budget-first Mixed Precision”.
Budget statt Presets
Herkommliche Quantisierungs-Tools bieten feste Presets wie Q4_K_M oder Q5_K_M - man waehlt einen und hofft, dass er passt. Shoehorn dreht den Ansatz um: Man gibt seinen tatsaechlichen Speicher an (GPU VRAM oder Apple Silicon Unified Memory), das Tool subtrahiert den Bedarf fuer KV-Cache und Runtime, und loest dann ein Per-Tensor-Mixed-Precision-Problem, um den Restbudget optimal zu fuellen.
Das Ergebnis nutzt regelmaessig 99,99% des Budgets - manchmal bis aufs Byte. Und Shoehorn liefert eine Perplexity-Zahl, damit man weiss, was die Kompression qualitativ kostet.
Praktische Details
- Output: Standard GGUF v3 - kompatibel mit allem, was llama.cpp laedt
- Backend: Benoetigt llama.cpp auf PATH (Homebrew installiert es automatisch)
- Plattformen: macOS (Apple Silicon), Linux (x86-64), Windows (x86-64, NVIDIA)
- Install:
brew install notactuallytreyanastasio/shoehorn/shoehorn - CLI:
shoehorn fit unsloth/Qwen3-4B-GGUF --serve - Web UI: Lokale Web-App mit Visualisierung des Speicherbudgets und Chat-Button
In-Browser Modell-Entdeckung
Die Website scannt Hugging Faces meist-downgeloadete Modelle und rankt sie nach dem, was euer Speicherbudget erlaubt - alles clientseitig, kein Server. Wer schon immer wissen wollte, welches Modell mit 16 GB VRAM noch gut laeuft, bekommt hier eine konkrete Antwort.
Implementiert ist Shoehorn uebrigens komplett in Rust - kein llama.cpp-Code verlinkt, nur als Backend genutzt.
Original: Shoehorn - Make any language model fit