machichdigital

Lokale LLMs · Foto: derekGavey, CC BY 2.0

ToolRunner-ToolsLizenz: MIT

llama.cpp

Zuletzt aktualisiert:

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Tool

Lizenz

MIT

Anwendungsfeld

Runner-Tools

Voraussetzungen

Keine besonderen — direkt loslegen.

Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.

So nutzt du es

Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.

Plattformen: überall (auch ARM/Raspberry Pi)

Im Detail

llama.cpp ist die Basistechnologie, auf der ein Großteil des lokalen KI-Ökosystems aufbaut: Ollama, LM Studio, KoboldCpp und viele andere Tools nutzen es im Hintergrund als Inferenz-Engine. Es läuft auf praktisch jeder Hardware – von CPU über CUDA, Metal und Vulkan bis ROCm, sogar auf ARM-Geräten wie dem Raspberry Pi. Wer direkt mit llama.cpp statt mit einer grafischen Oberfläche arbeitet, bekommt neue Features und Quantisierungsformate meist zuerst, muss dafür aber mit Kommandozeile und Kompilierung leben. Für Entwickler, die eigene Anwendungen bauen oder maximale Kontrolle über Parameter wie Kontextlänge und Sampling brauchen, ist es die richtige Ebene; für den schnellen Einstieg eignen sich Ollama oder LM Studio besser.

Praxis-Tipp

Direkt aus dem Quellcode bauen (z. B. mit Metal- oder CUDA-Flag), um sofort von neuen Optimierungen zu profitieren, statt auf ein Ollama-Update zu warten.

Siehe auch

Lizenz & Quelle

Erfahrungen & Kommentare.

Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Ollama

Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.

MIT♥ –⧉ –

LM Studio

Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.

Proprietär (App kostenlos, auch für Firmen; SDK/CLI: MIT)♥ –⧉ –

vLLM

Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.

Apache-2.0♥ –⧉ –