exo
Experimentell: mehrere Alltagsgeräte zu einem KI-Cluster zusammenschalten (Macs, PCs, sogar iPhones) — große Modelle laufen verteilt, die kein Einzelgerät stemmt.
Experimentell: mehrere Alltagsgeräte zu einem KI-Cluster zusammenschalten (Macs, PCs, sogar iPhones) — große Modelle laufen verteilt, die kein Einzelgerät stemmt.
So nutzt du es
Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.
Plattformen: macOS, Linux (P2P im LAN)
Im Detail
exo ist ein experimentelles Projekt, das ungenutzte Rechenleistung mehrerer Geräte im selben Netzwerk bündelt — Macs, PCs und sogar iPhones lassen sich per P2P zu einem Cluster zusammenschalten, auf dem dann Modelle laufen, die auf keinem der Einzelgeräte allein Platz hätten. Interessant für alle, die z. B. mehrere alte Laptops oder verteilte Hardware in einer WG haben und größere Modelle ausprobieren wollen, ohne in einen Server zu investieren. Als experimentelles Projekt ist es aber weniger stabil und langsamer als ein dediziertes Server-Setup mit vLLM oder llama.cpp — für den Produktivbetrieb eher ungeeignet.
Praxis-Tipp
Erst mit zwei, drei Geräten im selben WLAN testen, bevor man ein größeres Cluster plant — Netzwerklatenz ist oft der Flaschenhals.
Siehe auch
Lizenz & Quelle
- Lizenz: Apache-2.0
- Quelle: GitHub
Erfahrungen & Kommentare.
Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Ollama
Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.
LM Studio
Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.
llama.cpp
Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.
