Lokale LLMs · Foto: derekGavey, CC BY 2.0
exo
Zuletzt aktualisiert:
Typ
Tool
Lizenz
Apache-2.0
Quelle
Anwendungsfeld
Runner-Tools
Voraussetzungen
- Mehrere Geräte im selben Netzwerk (Macs, PCs, iPhones), die zusammengeschaltet werden sollen
- Technisches Vorwissen, da Setup und Betrieb experimentell sind
Einordnung
Setup und Betrieb sind experimentell und aufwendig, zudem werden mehrere Geräte und technisches Vorwissen vorausgesetzt.
Experimentell: mehrere Alltagsgeräte zu einem KI-Cluster zusammenschalten (Macs, PCs, sogar iPhones) — große Modelle laufen verteilt, die kein Einzelgerät stemmt.
Im Detail
exo ist ein experimentelles Cluster-Tool, das mehrere im selben Netzwerk vorhandene Geräte – Macs, PCs, sogar iPhones – per Peer-to-Peer zu einem gemeinsamen Rechenverbund zusammenschaltet. Die Idee: Ein einzelnes großes Sprachmodell, das auf keinem der Einzelgeräte Platz hätte, wird über mehrere Geräte verteilt und läuft dadurch trotzdem lokal, ganz ohne Cloud. Reizvoll, wenn mehrere ungenutzte Geräte zu Hause oder im Büro vorhanden sind, aber ausdrücklich experimentell: Setup, Stabilität und Geschwindigkeit sind längst nicht so ausgereift wie bei etablierten Single-Geräte-Lösungen. Eher etwas zum Ausprobieren als für den produktiven Alltagseinsatz.
Schritt für Schritt
- Prüfen, ob mehrere ungenutzte Geräte im eigenen Netzwerk für einen Cluster zur Verfügung stehen
- exo auf den beteiligten Geräten einrichten, sodass sie sich per Peer-to-Peer verbinden
- Ein großes Modell auswählen, das auf keinem der Einzelgeräte allein laufen würde, und auf den Verbund verteilen
- Stabilität und Geschwindigkeit im eigenen Netzwerk testen, bevor auf produktiven Einsatz gesetzt wird
Beispiel aus der Praxis
Jemand hat zu Hause zwei ältere Macs und ein iPhone ungenutzt herumstehen. Über exo werden die Geräte zu einem Cluster zusammengeschaltet, um ein großes Sprachmodell lokal laufen zu lassen, das auf keinem der Geräte einzeln Platz gefunden hätte.
Praxis-Tipp
Testen Sie exo zunächst mit zwei Geräten im selben WLAN und einem kleineren Modell, bevor Sie sich an große verteilte Setups wagen – Netzwerklatenz wird schnell zum Flaschenhals.
Stolperfallen
Als experimentelles Projekt ist mit Setup-Problemen sowie instabiler oder langsamer Ausführung zu rechnen. Wer eine zuverlässige Einzelgeräte-Lösung braucht, ist mit etablierten Tools besser bedient und sollte exo eher zum Ausprobieren als für den produktiven Einsatz einplanen.
Siehe auch
Lizenz & Quelle
- Lizenz: Apache-2.0
- Quelle: GitHub
Häufige Fragen.
Ist exo für den produktiven Einsatz geeignet?
Nein, das Projekt ist ausdrücklich experimentell und eher zum Ausprobieren gedacht als für den zuverlässigen Alltagseinsatz.
Brauche ich eine Cloud-Verbindung?
Nein, die Geräte werden per Peer-to-Peer im lokalen Netzwerk verbunden, das Modell läuft vollständig lokal.
Welche Geräte kann ich einbinden?
Laut Projekt unter anderem Macs, PCs und iPhones, die sich im selben Netzwerk befinden.
Erfahrungen & Kommentare.
Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Ollama
Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.
LM Studio
Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.
llama.cpp
Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.
