Article
Petals: LLMs zuhause betreiben, BitTorrent-style
Petals ist ein Open-Source-Projekt, das es ermoeglicht, grosse Sprachmodelle verteilt ueber ein Community-Netzwerk zu betreiben – aehnlich wie BitTorrent, aber fuer LLMs. Statt ein komplettes Modell auf einer einzelnen GPU laden zu muessen, verteilt Petals die Modelllayer auf mehrere Teilnehmer.
Wie es funktioniert
Das System unterstuetzt Modelle wie Llama 3.1 (bis 405B), Mixtral (8x22B), Falcon (40B+) und BLOOM (176B). Du verbindest dich mit einem verteilten Netzwerk, das Modelllayer hostet, und kannst Text generieren oder Modelle fine-tunen – direkt vom Desktop oder Google Colab aus. Die API ist so einfach wie AutoDistributedModelForCausalLM.from_pretrained() und verhaelt sich wie ein lokales Modell.
Laut den Entwicklern ist Petals bis zu 10x schneller als Offloading auf eine einzelne Maschine, da Layer parallel auf mehreren GPUs im Netzwerk verarbeitet werden.
Community-getrieben und Privatsphaere
Petals ist ein Community-System – es angiert darauf, dass Leute ihre GPUs teilen. Du kannst entweder einen Teil eines Modells hosten oder das Netzwerk nutzen. Fuer sensible Daten kann ein privater Swarm unter vertrauenswuerdigen Teilnehmern eingerichtet werden.
Das Projekt hat ueber 10.000 GitHub-Stars und 629 Forks, ist aber seit etwa 2 Jahren nicht mehr aktiv aktualisiert worden (letzter Commit vor 2 Jahren). Dennoch bleibt es ein interessanter Ansatz fuer dezentrales LLM-Inference, besonders fuer Entwickler ohne Zugang zu teurer GPU-Hardware.
Zum Original: petals.dev | GitHub