Ollama
Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.
Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.
So nutzt du es
Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.
Plattformen: macOS, Windows, Linux, Docker
Im Detail
Ollama ist die zentrale Infrastruktur-Schicht des lokalen KI-Ökosystems und faktisch der Standard, auf dem die meisten anderen Tools (Open WebUI, unzählige Pipelines) aufbauen. Mit einem Befehl wie “ollama run llama3.1” lädt und startet man Modelle, ganz ohne Python-Umgebung oder manuelle GGUF-Konvertierung – die integrierte Modell-Library übernimmt Quantisierung und Bereitstellung automatisch. Die OpenAI-kompatible API auf Port 11434 macht es zum universellen Backend für praktisch jedes Tool, das OpenAI-APIs spricht. Gegenüber llama.cpp (der Engine darunter) gewinnt es an Bedienkomfort, gegenüber LM Studio fehlt die GUI, dafür ist es besser scriptbar. Für den Einstieg in lokale LLMs die richtige erste Anlaufstelle.
Praxis-Tipp
Nach der Installation direkt “ollama run llama3.1” in der Konsole ausprobieren, danach im Open WebUI unter Einstellungen → Verbindungen die URL http://localhost:11434 eintragen.
Siehe auch
Lizenz & Quelle
- Lizenz: MIT
- Quelle: ollama.com
- Quelle: GitHub
Erfahrungen & Kommentare.
Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
LM Studio
Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.
llama.cpp
Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.
vLLM
Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.
