KoboldCpp
Einzel-Binary auf llama.cpp-Basis mit eigener Web-GUI; beliebt in der Rollenspiel-/Story-Community (Charaktere, Welten, lange Kontexte), kann auch Bilder (Stable Diffusion) und TTS.
Einzel-Binary auf llama.cpp-Basis mit eigener Web-GUI; beliebt in der Rollenspiel-/Story-Community (Charaktere, Welten, lange Kontexte), kann auch Bilder (Stable Diffusion) und TTS.
So nutzt du es
Tool über den verlinkten Anbieter installieren (Details und Systemvoraussetzungen im Repo). Diese Programme laden und betreiben lokale Modelle — sie sind der „Player“, das Modell ist die „Musik“.
Plattformen: macOS, Windows, Linux
Im Detail
KoboldCpp ist ein einzelnes, portables Programm ohne Installationsaufwand, das auf llama.cpp aufbaut und eine eigene Web-Oberfläche mitbringt statt sich auf externe Frontends zu verlassen. Der Fokus liegt klar auf interaktivem Storytelling: lange Kontexte, Charakterkarten und Weltenbau machen es zur ersten Wahl in der Rollenspiel- und Kreativ-Community, während generische Tools wie Ollama eher auf Chat und Automatisierung zielen. Zusätzlich lassen sich Stable-Diffusion-Bildgenerierung und Text-to-Speech direkt einbinden, sodass ein einziges Programm Text, Bild und Sprache abdeckt. Wer vor allem programmieren oder produktiv chatten will, ist mit llama.cpp direkt oder Open WebUI oft besser bedient.
Praxis-Tipp
Für lange Charaktergeschichten das integrierte Kontext-Management nutzen und ein Charakter-Karten-Preset laden, statt bei jedem Neustart den Systemprompt neu zu schreiben.
Siehe auch
Lizenz & Quelle
- Lizenz: AGPL-3.0 → nur Link
- Quelle: GitHub
Erfahrungen & Kommentare.
Funktioniert der Tool bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Ollama
Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.
LM Studio
Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.
llama.cpp
Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.
