Tools

Shoehorn: Jedes LLM in deinen Arbeitsspeicher quetschen

llm quantisierung gguf local-ai rust

Shoehorn ist ein frisches Open-Source-Tool, das ein grundlegendes Problem beim lokalen LLM-Betrieb loest: Wie passt ein grosses Modell in begrenzten Speicher? Die Antwort ist nicht “naechster Preset”, sondern “budget-first Mixed Precision”.

Budget statt Presets

Herkommliche Quantisierungs-Tools bieten feste Presets wie Q4_K_M oder Q5_K_M - man waehlt einen und hofft, dass er passt. Shoehorn dreht den Ansatz um: Man gibt seinen tatsaechlichen Speicher an (GPU VRAM oder Apple Silicon Unified Memory), das Tool subtrahiert den Bedarf fuer KV-Cache und Runtime, und loest dann ein Per-Tensor-Mixed-Precision-Problem, um den Restbudget optimal zu fuellen.

Das Ergebnis nutzt regelmaessig 99,99% des Budgets - manchmal bis aufs Byte. Und Shoehorn liefert eine Perplexity-Zahl, damit man weiss, was die Kompression qualitativ kostet.

Praktische Details

  • Output: Standard GGUF v3 - kompatibel mit allem, was llama.cpp laedt
  • Backend: Benoetigt llama.cpp auf PATH (Homebrew installiert es automatisch)
  • Plattformen: macOS (Apple Silicon), Linux (x86-64), Windows (x86-64, NVIDIA)
  • Install: brew install notactuallytreyanastasio/shoehorn/shoehorn
  • CLI: shoehorn fit unsloth/Qwen3-4B-GGUF --serve
  • Web UI: Lokale Web-App mit Visualisierung des Speicherbudgets und Chat-Button

In-Browser Modell-Entdeckung

Die Website scannt Hugging Faces meist-downgeloadete Modelle und rankt sie nach dem, was euer Speicherbudget erlaubt - alles clientseitig, kein Server. Wer schon immer wissen wollte, welches Modell mit 16 GB VRAM noch gut laeuft, bekommt hier eine konkrete Antwort.

Implementiert ist Shoehorn uebrigens komplett in Rust - kein llama.cpp-Code verlinkt, nur als Backend genutzt.

Original: Shoehorn - Make any language model fit