LM Studio
Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.
Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.
So nutzt du es
Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.
Plattformen: macOS, Windows, Linux
Im Detail
LM Studio ist die komfortabelste Desktop-Oberfläche für lokale LLMs: Modelle direkt aus Hugging Face suchen und herunterladen, im Chat-Fenster testen, Parameter wie Temperatur oder Kontextlänge per Regler einstellen und eigene Dokumente per Drag-and-drop für RAG einbinden. Zusätzlich startet es einen lokalen, OpenAI-kompatiblen API-Server, sodass sich andere Tools problemlos anbinden lassen. Auf Apple Silicon läuft es zusätzlich mit MLX-Backend, oft schneller als reines llama.cpp. Im Vergleich zu Ollama ist LM Studio weniger Kommandozeile, mehr Klicken – ideal für Einsteiger und alle, die Modelle bequem ausprobieren wollen, statt sich mit Terminal-Befehlen zu beschäftigen.
Praxis-Tipp
Im „Discover“-Tab nach quantisierten GGUF- oder MLX-Versionen filtern und die Empfehlung passend zur eigenen RAM-Größe laden, dann über „Local Server“ die OpenAI-API-URL für andere Apps kopieren.
Siehe auch
Lizenz & Quelle
- Lizenz: Proprietär (App kostenlos, auch für Firmen; SDK/CLI: MIT)
- Quelle: lmstudio.ai
Erfahrungen & Kommentare.
Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Ollama
Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.
llama.cpp
Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.
vLLM
Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.
