machichdigital
ToolRunner-ToolsLizenz: MIT

llama.cpp

Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.

× kopiert× heruntergeladenBewertung:

Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.

So nutzt du es

Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.

Plattformen: überall (auch ARM/Raspberry Pi)

Im Detail

llama.cpp ist die C/C++-Inferenz-Engine, die im Hintergrund fast aller lokalen LLM-Tools steckt – Ollama, LM Studio, GPT4All und viele mehr bauen darauf auf. Es lädt GGUF-quantisierte Modelle und läuft auf praktisch jeder Hardware: reine CPU, Nvidia (CUDA), Apple (Metal), AMD (ROCm), sogar Vulkan-GPUs und ARM-Geräte wie den Raspberry Pi. Wer direkt mit llama.cpp statt einer GUI arbeitet, hat mehr Kontrolle über Parameter, Quantisierungsstufen und Server-Flags und bekommt neue Modell-Unterstützung meist zuerst – zahlt dafür mit einer kommandozeilenlastigen Bedienung ohne Komfortfunktionen wie Modell-Suche oder Chat-Verlauf.

Praxis-Tipp

Für schnelle Tests reicht ./llama-server -m modell.gguf --port 8080 – danach läuft eine OpenAI-kompatible API, die sich in Open WebUI oder eigene Skripte einbinden lässt.

Siehe auch

Lizenz & Quelle

Erfahrungen & Kommentare.

Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Ollama

Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.

MIT

LM Studio

Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.

Proprietär (App kostenlos, auch für Firmen; SDK/CLI: MIT)

vLLM

Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.

Apache-2.0