Open WebUI
Die beliebteste Web-Oberfläche für Ollama & OpenAI-kompatible APIs: Multi-User mit Rechten, RAG, Websuche, Bild-Generierung, Pipelines-Plugins. Perfekt als „Familien-/Team-ChatGPT" auf dem Heimserver. (Die zugehörigen Pipelines sind MIT → kuratierte Beispiele in ../Ollama/.)
Die beliebteste Web-Oberfläche für Ollama & OpenAI-kompatible APIs: Multi-User mit Rechten, RAG, Websuche, Bild-Generierung, Pipelines-Plugins. Perfekt als „Familien-/Team-ChatGPT“ auf dem Heimserver. (Die zugehörigen Pipelines sind MIT → kuratierte Beispiele in ../Ollama/.)
So nutzt du es
Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.
Plattformen: Docker, pip (Server mit Browser-UI)
Im Detail
Open WebUI ist die meistgenutzte Oberfläche für lokal gehostete Sprachmodelle und funktioniert mit Ollama, llama.cpp, vLLM und jeder OpenAI-kompatiblen API. Im Vergleich zu schlankeren Clients wie Jan oder GPT4All bietet es Mehrbenutzerbetrieb mit Rechteverwaltung, RAG über eigene Dokumente, Websuche-Integration, Bildgenerierung und ein Plugin-System (Pipelines). Damit wird aus einem lokalen Modell schnell ein „Familien- oder Team-ChatGPT“ auf dem eigenen Server. Der große Funktionsumfang macht es etwas komplexer als reine Chat-Clients, ist aber die richtige Wahl, sobald mehrere Personen zugreifen oder Zusatzfunktionen wie Dokumentensuche gefragt sind.
Praxis-Tipp
Zusammen mit Ollama im selben Docker-Netzwerk starten, dann unter Einstellungen → Dokumente eigene PDFs für RAG hochladen.
Siehe auch
Lizenz & Quelle
Erfahrungen & Kommentare.
Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Ollama
Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.
LM Studio
Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.
llama.cpp
Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.
