machichdigital

Lokale LLMs · Foto: derekGavey, CC BY 2.0

ToolRunner-ToolsLizenz: Apache-2.0

vLLM

Zuletzt aktualisiert:

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Tool

Lizenz

Apache-2.0

Anwendungsfeld

Runner-Tools

Voraussetzungen

Keine besonderen — direkt loslegen.

Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.

So nutzt du es

Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.

Plattformen: Linux (NVIDIA/AMD GPU), Docker

Im Detail

vLLM ist kein Werkzeug für den Chat auf dem eigenen Laptop, sondern ein Inferenzserver für den Produktionseinsatz. Durch Techniken wie PagedAttention (effiziente Verwaltung des GPU-Speichers) und Continuous Batching kann es deutlich mehr gleichzeitige Anfragen auf derselben GPU-Hardware bedienen als klassische Serving-Lösungen. Damit ist es die naheliegende Wahl, wenn ein Team oder eine Anwendung ein selbst gehostetes Modell für viele Nutzer gleichzeitig bereitstellen muss, etwa als OpenAI-kompatible API hinter einer eigenen App. Voraussetzung ist eine Linux-Maschine mit NVIDIA- oder AMD-GPU; ohne dedizierte GPU-Hardware oder für Einzelnutzer-Setups sind Ollama oder llama.cpp deutlich einfacher und ausreichend.

Praxis-Tipp

vLLM per Docker starten und über die integrierte OpenAI-kompatible API (/v1/chat/completions) ansprechen – so lässt es sich als Drop-in-Ersatz für die OpenAI-API einbinden.

Siehe auch

Lizenz & Quelle

Erfahrungen & Kommentare.

Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Ollama

Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.

MIT♥ –⧉ –

LM Studio

Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.

Proprietär (App kostenlos, auch für Firmen; SDK/CLI: MIT)♥ –⧉ –

llama.cpp

Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.

MIT♥ –⧉ –