Models

Liquid AI LFM2.5: Q4_0 ohne Qualitaetsverlust dank QAD

liquid-ai lfm quantization gguf edge-ai llama-cpp

Liquid AI veroeffentlicht QAD-Q4_0-GGUFs fuer die LFM2.5-Modellfamilie (230M, 350M, 1.2B-Instruct, 2.6B). Die neue Methode der Quantization-Aware Distillation (QAD) loest ein altbekanntes Problem: 4-Bit-Quantisierung kostet Genauigkeit. QAD aendert das.

Wie QAD funktioniert

Anstatt das Modell erst zu trainieren und danach zu quantisieren (Post-Training Quantization / PTQ), wird ein hochpraeziser Teacher im BF16-Format in einen bereits quantisierten Student destilliert. Das Ergebnis: die Modelle behalten Q4_0-Speicherbedarf und -Geschwindigkeit, recovern aber 97% der verlorenen BF16-Accuracy.

Benchmarks

Getestet wurde auf GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF und BFCLv4. Die QAD-Checkpoints erreichen 96,5-97,4% ihrer jeweiligen BF16-Baselines. Auf Edge-Hardware (MacBook Pro, NucBox, Galaxy S26, Raspberry Pi 5) liefern sie 3-33% hoeheren Decode-Throughput als vergleichbare Q5_K_M- oder Q4_K_M-Modelle.

Praxis

Die GGUFs laufen direkt in llama.cpp oder kompatiblen Runtimes:

llama-cli -hf LiquidAI/LFM2.5-350M --hf-file LFM2.5-350M-QAD-Q4_0.gguf -p "What is C. elegans?"

Verfuegbar sind alle vier Modelle ab sofort auf Hugging Face. Besonders interessant fuer Edge-Deployment und lokale Agenten, wo jeder Kilobyte und jede Millisekunde zaehlt.

Link: Liquid AI Blog