vLLM
Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.
Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.
So nutzt du es
Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.
Plattformen: Linux (NVIDIA/AMD GPU), Docker
Im Detail
vLLM ist ein Inferenzserver für den Produktivbetrieb, der dank PagedAttention und Continuous Batching deutlich mehr gleichzeitige Anfragen pro GPU verarbeitet als klassische Serving-Lösungen. Er ist die erste Wahl, wenn ein Modell mehreren Nutzern oder einer App mit spürbarer Last dienen soll – etwa als Backend für einen internen Chatbot oder eine API mit vielen gleichzeitigen Requests. Läuft unter Linux mit NVIDIA- oder AMD-GPU, meist per Docker. Für den eigenen Rechner oder gelegentliche Anfragen ist vLLM überdimensioniert und komplizierter aufzusetzen als Ollama oder LM Studio; sein Vorteil zeigt sich erst bei echter Serverlast und mehreren parallelen Nutzern.
Praxis-Tipp
vLLM lohnt sich, sobald mehr als eine Handvoll Personen gleichzeitig auf dasselbe Modell zugreifen – für Einzelnutzung auf dem eigenen Rechner bleib bei Ollama oder LM Studio.
Siehe auch
Lizenz & Quelle
Erfahrungen & Kommentare.
Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Ollama
Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.
LM Studio
Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.
llama.cpp
Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.
