tutorials
Ein 8B-Modell auf einer 4-GB-Laptop-GPU finetunen mit Layer Streaming
Wer schon mal versucht hat, ein 8B-Modell auf einem 4-GB-Laptop-GPU zu finetunen, weiss, dass das normalerweise schlichtweg nicht geht – der VRAM reicht nicht mal fuer die Gewichte, geschweige denn fuer Gradienten und Optimizer-States. Genau da setzt Soup an, ein CLI-Tool von Alpamys Makazhan, das den Schmerz aus dem LLM-Finetuning nimmt: eine YAML-Config, ein soup train-Kommando, fertig. Kein SSH, keine endlosen Framework-Konfigurationen.
Der eigentliche Trick ist Layer Streaming. Statt die gefrorene Basis komplett in den VRAM zu laden, laedt Soup die Decoder-Schichten nacheinander aus dem RAM – eine Schicht rein, durchrechnen, raus. Nur der LoRA-Adapter bleibt auf der GPU. Mit 4-bit-Quantisierung (NF4) passt so ein 8B-Modell auf eine Karte, die eigentlich dafuer zu klein ist. Der Maintainer entwickelt das gesamte Tool auf genau so einem 4-GB-Laptop – jedes Performance-Zahl in den Docs ist gemessen, nicht behauptet.
Ab v0.72.4 laufen neben SFT auch DPO, ORPO, SimPO und KTO ueber Layer Streaming, und das Ganze ist bit-exact gegen eine normale, nicht-gestreamte Trainings-Session. Wer also ein Modell lokal anpassen will ohne Cloud-Geld zu verbrennen, sollte sich Soup definitiv anschauen.