machichdigital

Lokale LLMs · Foto: derekGavey, CC BY 2.0

ToolRunner-ToolsLizenz: Apache-2.0

exo

Zuletzt aktualisiert:

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Tool

Lizenz

Apache-2.0

Anwendungsfeld

Runner-Tools

Voraussetzungen

  • Mehrere Geräte im selben Netzwerk (Macs, PCs, iPhones), die zusammengeschaltet werden sollen
  • Technisches Vorwissen, da Setup und Betrieb experimentell sind

Einordnung

AufwandEinrichtung & Einarbeitung4/5 · eher hochNutzenErtrag im Alltag2/5 · eher geringVoraussetzungenWas vorher da sein muss4/5 · eher hoch1 = gering5 = hoch

Setup und Betrieb sind experimentell und aufwendig, zudem werden mehrere Geräte und technisches Vorwissen vorausgesetzt.

Experimentell: mehrere Alltagsgeräte zu einem KI-Cluster zusammenschalten (Macs, PCs, sogar iPhones) — große Modelle laufen verteilt, die kein Einzelgerät stemmt.

Im Detail

exo ist ein experimentelles Cluster-Tool, das mehrere im selben Netzwerk vorhandene Geräte – Macs, PCs, sogar iPhones – per Peer-to-Peer zu einem gemeinsamen Rechenverbund zusammenschaltet. Die Idee: Ein einzelnes großes Sprachmodell, das auf keinem der Einzelgeräte Platz hätte, wird über mehrere Geräte verteilt und läuft dadurch trotzdem lokal, ganz ohne Cloud. Reizvoll, wenn mehrere ungenutzte Geräte zu Hause oder im Büro vorhanden sind, aber ausdrücklich experimentell: Setup, Stabilität und Geschwindigkeit sind längst nicht so ausgereift wie bei etablierten Single-Geräte-Lösungen. Eher etwas zum Ausprobieren als für den produktiven Alltagseinsatz.

Schritt für Schritt

  1. Prüfen, ob mehrere ungenutzte Geräte im eigenen Netzwerk für einen Cluster zur Verfügung stehen
  2. exo auf den beteiligten Geräten einrichten, sodass sie sich per Peer-to-Peer verbinden
  3. Ein großes Modell auswählen, das auf keinem der Einzelgeräte allein laufen würde, und auf den Verbund verteilen
  4. Stabilität und Geschwindigkeit im eigenen Netzwerk testen, bevor auf produktiven Einsatz gesetzt wird

Beispiel aus der Praxis

Jemand hat zu Hause zwei ältere Macs und ein iPhone ungenutzt herumstehen. Über exo werden die Geräte zu einem Cluster zusammengeschaltet, um ein großes Sprachmodell lokal laufen zu lassen, das auf keinem der Geräte einzeln Platz gefunden hätte.

Praxis-Tipp

Testen Sie exo zunächst mit zwei Geräten im selben WLAN und einem kleineren Modell, bevor Sie sich an große verteilte Setups wagen – Netzwerklatenz wird schnell zum Flaschenhals.

Stolperfallen

Als experimentelles Projekt ist mit Setup-Problemen sowie instabiler oder langsamer Ausführung zu rechnen. Wer eine zuverlässige Einzelgeräte-Lösung braucht, ist mit etablierten Tools besser bedient und sollte exo eher zum Ausprobieren als für den produktiven Einsatz einplanen.

Siehe auch

Lizenz & Quelle

  • Lizenz: Apache-2.0
  • Quelle: GitHub

Häufige Fragen.

Ist exo für den produktiven Einsatz geeignet?

Nein, das Projekt ist ausdrücklich experimentell und eher zum Ausprobieren gedacht als für den zuverlässigen Alltagseinsatz.

Brauche ich eine Cloud-Verbindung?

Nein, die Geräte werden per Peer-to-Peer im lokalen Netzwerk verbunden, das Modell läuft vollständig lokal.

Welche Geräte kann ich einbinden?

Laut Projekt unter anderem Macs, PCs und iPhones, die sich im selben Netzwerk befinden.

Erfahrungen & Kommentare.

Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Ollama

Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.

MIT♥ –⧉ –

LM Studio

Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.

Proprietär (App kostenlos, auch für Firmen; SDK/CLI: MIT)♥ –⧉ –

llama.cpp

Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.

MIT♥ –⧉ –