machichdigital
ToolRunner-ToolsLizenz: Apache-2.0

vLLM

Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.

× kopiert× heruntergeladenBewertung:

Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.

So nutzt du es

Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.

Plattformen: Linux (NVIDIA/AMD GPU), Docker

Im Detail

vLLM ist ein Inferenzserver für den Produktivbetrieb, der dank PagedAttention und Continuous Batching deutlich mehr gleichzeitige Anfragen pro GPU verarbeitet als klassische Serving-Lösungen. Er ist die erste Wahl, wenn ein Modell mehreren Nutzern oder einer App mit spürbarer Last dienen soll – etwa als Backend für einen internen Chatbot oder eine API mit vielen gleichzeitigen Requests. Läuft unter Linux mit NVIDIA- oder AMD-GPU, meist per Docker. Für den eigenen Rechner oder gelegentliche Anfragen ist vLLM überdimensioniert und komplizierter aufzusetzen als Ollama oder LM Studio; sein Vorteil zeigt sich erst bei echter Serverlast und mehreren parallelen Nutzern.

Praxis-Tipp

vLLM lohnt sich, sobald mehr als eine Handvoll Personen gleichzeitig auf dasselbe Modell zugreifen – für Einzelnutzung auf dem eigenen Rechner bleib bei Ollama oder LM Studio.

Siehe auch

Lizenz & Quelle

Erfahrungen & Kommentare.

Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Ollama

Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.

MIT

LM Studio

Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.

Proprietär (App kostenlos, auch für Firmen; SDK/CLI: MIT)

llama.cpp

Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.

MIT