Lokale LLMs · Foto: derekGavey, CC BY 2.0
LM Studio
Zuletzt aktualisiert:
Typ
Tool
Lizenz
Proprietär (App kostenlos, auch für Firmen; SDK/CLI: MIT)
Quelle
Anwendungsfeld
Runner-Tools
Voraussetzungen
Keine besonderen — direkt loslegen.
Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.
So nutzt du es
Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.
Plattformen: macOS, Windows, Linux
Im Detail
LM Studio richtet sich an Nutzer, die lokale Sprachmodelle ohne Kommandozeile bedienen wollen: Ein integrierter Katalog durchsucht Hugging Face, zeigt Speicherbedarf pro Modell an und lädt es per Klick. Parameter wie Temperatur oder Kontextlänge lassen sich über Regler statt Config-Dateien anpassen, eigene Dokumente per Drag-and-drop für RAG einbinden. Besonders praktisch: LM Studio startet auch einen lokalen OpenAI-kompatiblen API-Server, sodass eigene Skripte oder Apps wie gewohnt per API zugreifen können. Auf Apple Silicon nutzt es zusätzlich das schnellere MLX-Format. Im Vergleich zu Ollama ist LM Studio weniger für Automatisierung per Terminal gedacht, dafür deutlich zugänglicher für alle, die lieber grafisch arbeiten.
Praxis-Tipp
Für den Einstieg reicht es, im Modell-Katalog nach „7B“ oder „8B“ zu filtern und ein Modell zu laden, das laut Anzeige in Ihren verfügbaren Arbeitsspeicher passt.
Siehe auch
Lizenz & Quelle
- Lizenz: Proprietär (App kostenlos, auch für Firmen; SDK/CLI: MIT)
- Quelle: lmstudio.ai
Erfahrungen & Kommentare.
Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Ollama
Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.
llama.cpp
Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.
vLLM
Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.
