Lokale LLMs · Foto: derekGavey, CC BY 2.0
vLLM
Zuletzt aktualisiert:
Typ
Tool
Lizenz
Apache-2.0
Quelle
Anwendungsfeld
Runner-Tools
Voraussetzungen
Keine besonderen — direkt loslegen.
Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.
So nutzt du es
Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.
Plattformen: Linux (NVIDIA/AMD GPU), Docker
Im Detail
vLLM ist kein Werkzeug für den Chat auf dem eigenen Laptop, sondern ein Inferenzserver für den Produktionseinsatz. Durch Techniken wie PagedAttention (effiziente Verwaltung des GPU-Speichers) und Continuous Batching kann es deutlich mehr gleichzeitige Anfragen auf derselben GPU-Hardware bedienen als klassische Serving-Lösungen. Damit ist es die naheliegende Wahl, wenn ein Team oder eine Anwendung ein selbst gehostetes Modell für viele Nutzer gleichzeitig bereitstellen muss, etwa als OpenAI-kompatible API hinter einer eigenen App. Voraussetzung ist eine Linux-Maschine mit NVIDIA- oder AMD-GPU; ohne dedizierte GPU-Hardware oder für Einzelnutzer-Setups sind Ollama oder llama.cpp deutlich einfacher und ausreichend.
Praxis-Tipp
vLLM per Docker starten und über die integrierte OpenAI-kompatible API (/v1/chat/completions) ansprechen – so lässt es sich als Drop-in-Ersatz für die OpenAI-API einbinden.
Siehe auch
Lizenz & Quelle
Erfahrungen & Kommentare.
Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Ollama
Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.
LM Studio
Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.
llama.cpp
Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.
