Models
Liquid AI LFM2.5: Q4_0 ohne Qualitaetsverlust dank QAD
Liquid AI veroeffentlicht QAD-Q4_0-GGUFs fuer die LFM2.5-Modellfamilie (230M, 350M, 1.2B-Instruct, 2.6B). Die neue Methode der Quantization-Aware Distillation (QAD) loest ein altbekanntes Problem: 4-Bit-Quantisierung kostet Genauigkeit. QAD aendert das.
Wie QAD funktioniert
Anstatt das Modell erst zu trainieren und danach zu quantisieren (Post-Training Quantization / PTQ), wird ein hochpraeziser Teacher im BF16-Format in einen bereits quantisierten Student destilliert. Das Ergebnis: die Modelle behalten Q4_0-Speicherbedarf und -Geschwindigkeit, recovern aber 97% der verlorenen BF16-Accuracy.
Benchmarks
Getestet wurde auf GPQA Diamond, MMLU-Pro, IFEval, IFBench, Multi-IF und BFCLv4. Die QAD-Checkpoints erreichen 96,5-97,4% ihrer jeweiligen BF16-Baselines. Auf Edge-Hardware (MacBook Pro, NucBox, Galaxy S26, Raspberry Pi 5) liefern sie 3-33% hoeheren Decode-Throughput als vergleichbare Q5_K_M- oder Q4_K_M-Modelle.
Praxis
Die GGUFs laufen direkt in llama.cpp oder kompatiblen Runtimes:
llama-cli -hf LiquidAI/LFM2.5-350M --hf-file LFM2.5-350M-QAD-Q4_0.gguf -p "What is C. elegans?"
Verfuegbar sind alle vier Modelle ab sofort auf Hugging Face. Besonders interessant fuer Edge-Deployment und lokale Agenten, wo jeder Kilobyte und jede Millisekunde zaehlt.
Link: Liquid AI Blog