machichdigital

Lokale LLMs · Foto: derekGavey, CC BY 2.0

ToolRunner-ToolsLizenz: MIT

Ollama

Zuletzt aktualisiert:

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Tool

Lizenz

MIT

Anwendungsfeld

Runner-Tools

Voraussetzungen

Keine besonderen — direkt loslegen.

Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.

So nutzt du es

Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.

Plattformen: macOS, Windows, Linux, Docker

Im Detail

Ollama ist die einfachste Möglichkeit, Open-Source-Sprachmodelle lokal auszuführen. Ein Befehl (ollama run llama3.1) lädt das Modell aus der eingebauten Library und startet einen Chat im Terminal. Im Hintergrund läuft ein Server mit OpenAI-kompatibler API auf Port 11434, sodass sich praktisch jedes Tool, das ChatGPT über die API anspricht, stattdessen gegen Ollama richten lässt. Genau das macht Ollama zum Rückgrat des lokalen KI-Ökosystems: Open WebUI, unzählige Pipelines und Plugins bauen direkt darauf auf. Für alle, die schnell und ohne Konfigurationsaufwand ein Modell testen wollen, ist es der naheliegende Einstieg — wer volle Kontrolle über Quantisierung und Hardware-Tuning braucht, schaut zusätzlich bei llama.cpp vorbei.

Praxis-Tipp

Mit ollama pull llama3.1 das Modell laden, dann ollama run llama3.1 “Erkläre mir X” direkt im Terminal testen — für eine grafische Oberfläche Open WebUI davorschalten.

Siehe auch

Lizenz & Quelle

Erfahrungen & Kommentare.

Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

LM Studio

Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.

Proprietär (App kostenlos, auch für Firmen; SDK/CLI: MIT)♥ –⧉ –

llama.cpp

Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.

MIT♥ –⧉ –

vLLM

Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.

Apache-2.0♥ –⧉ –