Ollama
Empfehlung EinstiegFür: Terminal-affin, will Modelle auch in Skripte einbinden
Schlank, schnell, riesige Modell-Auswahl. Eine grafische Oberfläche holt man sich bei Bedarf mit Open WebUI dazu.
Zur Website ↗Tutorial
Jede Anfrage an ChatGPT, Gemini oder Claude verlässt heute Ihr Gerät und landet auf fremden Servern. Für vieles ist das egal — für die Notiz mit den Medikamenten, das Foto vom Ausweis oder die vertrauliche Nachricht nicht.
Die Lösung heißt lokale KI: ein Sprachmodell, das komplett auf Ihrem eigenen Rechner läuft. Kein Konto, keine Cloud, und — der Punkt, der zählt — die Frage verlässt das Gerät gar nicht erst. Diese Anleitung bringt Sie in wenigen Minuten dorthin, ohne Vorwissen.
Vier gute, kostenlose Wege. Alle schicken standardmäßig nichts in die Cloud — der Unterschied ist vor allem Geschmack.
Für: Terminal-affin, will Modelle auch in Skripte einbinden
Schlank, schnell, riesige Modell-Auswahl. Eine grafische Oberfläche holt man sich bei Bedarf mit Open WebUI dazu.
Zur Website ↗Für: Will ein fertiges Fenster, kein Terminal
Sieht aus wie ein Chat-Programm, eingebaute Modell-Suche, zeigt sogar an, welche Modelle auf die eigene Hardware passen.
Zur Website ↗Für: Legt Wert auf Transparenz und Open Source
Die quelloffene Alternative zu LM Studio: aufgeräumt, komplett offline nutzbar, Code einsehbar.
Zur Website ↗Für: Schwächere Hardware, eigene Dokumente befragen
Sehr niedrigschwellig, läuft auch auf älteren Rechnern, bringt eine Funktion zum Befragen eigener PDFs mit.
Zur Website ↗Der schnellste Einstieg. Läuft auf Mac, Windows und Linux.
Schritt 1 — Installieren
Mac / Windows: Installer von ollama.com laden, Doppelklick, fertig.
Linux (im Terminal):
curl -fsSL https://ollama.com/install.sh | shSchritt 2 — Ein Modell holen und starten
ollama run llama3.2Beim ersten Mal lädt Ollama das Modell (ein paar Gigabyte), danach chatten Sie direkt im Terminal. Beenden mit /bye.
Schritt 3 (optional) — Ein richtiges Fenster statt Terminal
Open WebUI gibt Ihnen eine ChatGPT-artige Oberfläche über Ollama. Voraussetzung ist Docker:
docker run -d -p 3000:8080 \ --add-host=host.docker.internal:host-gateway \ -v open-webui:/app/backend/data \ --name open-webui ghcr.io/open-webui/open-webui:mainDann im Browser http://localhost:3000 öffnen.
Grobe Faustregel — mehr Arbeitsspeicher (RAM) erlaubt größere, klügere Modelle.
| Ihr Rechner | Empfohlene Modelle | Was Sie erwartet |
|---|---|---|
| 8 GB RAM | llama3.2 (3B), phi3 | Flott, für einfache Aufgaben und Chat gut geeignet |
| 16 GB RAM | mistral (7B), llama3.1 (8B) | Spürbar klüger, guter Alltags-Sweetspot |
| 32 GB+ / gute GPU | qwen2.5:14b, gemma2:27b | Richtung Cloud-Niveau, auch für Code |
Datensparsam eingebunden: Das Video wird erst nach Ihrem Klick von YouTube geladen — vorher gibt es keine Verbindung dorthin.
🎬 Video-Tutorial folgt
Lokale KI mit Ollama einrichten — kommt in Kürze, dann als datensparsame 2-Klick-Einbindung.
Das ist der eigentliche Gewinn: Ein Modell, das lokal läuft, sendet Ihre Eingaben an keinen Server. Keine Cloud, kein US-Anbieter, kein CLOUD Act — DSGVO-technisch unkritisch, weil schlicht keine Daten das Gerät verlassen. Für Berufe mit Schweigepflicht oder sensiblen Unterlagen ist das oft der Unterschied zwischen „darf ich nutzen" und „darf ich nicht".
Läuft es? Hakt es irgendwo?
Im Community-Forum tauschen wir Hardware-Kombis, Modell-Empfehlungen und Stolpersteine aus. Fragen sind ausdrücklich erwünscht.
Zum Forum