machichdigital

Lokale LLMs — Modelle, Ollama & Runner.

Lokale Modelle heißen: keine Cloud, keine API-Kosten, volle Datenkontrolle. Dieser Bereich ist der Schwerpunkt des Verzeichnisses.

104 Einträge · alle geprüft · kostenlos

Alle 104 Einträge durchblättern →

Welches Modell passt in Ihren Rechner?

Faustregel für die übliche 4-Bit-Quantisierung: Die Modellgröße (Parameter) bestimmt den Arbeitsspeicher-Bedarf. Mehr RAM = klügere Modelle.

3–4B6 GB RAMz. B. Llama 3.2, Gemma 3 4B, Qwen 3 4B7–8B8 GB RAMz. B. Mistral 7B, Llama 3.1 8B12–14B16 GB RAMz. B. Mistral NeMo, Qwen 2.5 14B27–34B32 GB RAMz. B. Gemma 3 27B, Qwen 3 32B70B64 GB RAMz. B. Llama 3.3 70B

Und womit ausführen? Die Runner im Vergleich.

WerkzeugBedienungEigene Dokumente (RAG)LizenzIdeal für
OllamaTerminal (+ Open WebUI)über ZusätzeMITSkripte, Entwickler, Server
LM StudioFertige Appeingebaut (Chat mit Dateien)proprietär (kostenlos)Einsteiger, die ein Fenster wollen
JanFertige AppeingebautOpen Source (AGPL)Transparenz-Fans, offline
GPT4AllFertige Appeingebaut (LocalDocs)MITÄltere/schwache Rechner
Open WebUIBrowser (über Ollama)eingebaut (Upload + Fragen)Open Source (BSD)ChatGPT-Gefühl im Browser

Alle fünf stehen mit Anleitung hier im Verzeichnis (Runner-Tools) — und die Schritt-für-Schritt-Einrichtung gibt es unterLokale KI installieren.

Lokale LLM-Modelle.67 Einträge

Stand: Juli 2026. Die Modell-Landschaft bewegt sich schnell — neueste Versionen/Checkpoints immer direkt in der [Ollama-Library](https://ollama.com/library) bzw. auf [Hugging Face](https://huggingface.co/models) nachschlagen. ---

Llama 3.1

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

Llama 3.1 Community License♥ –⧉ –

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License♥ –⧉ –

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)♥ –⧉ –

Qwen 2.5

Alibabas Arbeitspferd: stark in vielen Sprachen (auch Deutsch), Mathe und strukturierten Ausgaben (JSON). Die Apache-Größen sind auch kommerziell völlig frei.

Apache-2.0 (7B/14B/32B); 3B + 72B: eigene Qwen-Lizenz♥ –⧉ –

Qwen 3

Aktuelle Qwen-Generation mit umschaltbarem „Thinking"-Modus (überlegt vor der Antwort). Das MoE 30B-A3B ist ein Geheimtipp: 30B-Qualität bei Geschwindigkeit eines kleinen Modells.

Apache-2.0♥ –⧉ –

Mistral 7B

Der Klassiker unter den freien 7B-Modellen: schnell, genügsam, gute Basis für Feintuning. Inzwischen von Neuerem überholt, aber weiterhin grundsolide.

Apache-2.0♥ –⧉ –

Mistral Small 3.x

Sehr starkes, komplett freies Mittelklasse-Modell aus Europa; neuere Versionen auch mit Bildverständnis. Top-Wahl für 32-GB-Macs und RTX-3090/4090-Besitzer.

Apache-2.0♥ –⧉ –

Mistral NeMo

Gemeinsam mit NVIDIA entwickelt, 128K Kontext, ausdrücklich mehrsprachig (gutes Deutsch). Guter Mittelweg zwischen 7B und 24B.

Apache-2.0♥ –⧉ –

Ministral

Mistrals Edge-Reihe für Geräte-nahe Anwendungen. Wegen der Research-Lizenz nur für private/Forschungszwecke frei.

Mistral Research License (8B — nicht kommerziell, Lizenz prüfen!)♥ –⧉ –

Mixtral

Der MoE-Pionier von Ende 2023. Heute meist durch Qwen 3 MoE oder Mistral Small ersetzt, aber lizenzrechtlich völlig frei.

Apache-2.0♥ –⧉ –

Gemma 2

Googles Vorgänger-Generation, immer noch beliebt: 9B schreibt angenehm natürliche Texte, auch auf Deutsch.

Gemma Terms of Use♥ –⧉ –

Gemma 3

Googles aktuelle offene Reihe: ab 4B multimodal (versteht Bilder), 128K Kontext, über 100 Sprachen. 12B ist ein exzellenter Allrounder für 16-GB-Rechner.

Gemma Terms of Use♥ –⧉ –

Phi-4

Microsofts „klein aber schlau"-Reihe: mit synthetischen Lehrbuch-Daten trainiert, überraschend stark in Mathe/Logik. MIT-Lizenz = maximal frei.

MIT♥ –⧉ –

DeepSeek-V3 / V3.x

Eines der stärksten offenen Modelle überhaupt — GPT-4-Klasse. Lokal nur mit Server-Hardware realistisch; für Normalos sind die R1-Distills (s. Reasoning) der Weg.

MIT (neuere Checkpoints; ältere: DeepSeek Model License)♥ –⧉ –

GLM-4

Chinesische Alternative mit gutem Multilingual-Support und Tool-Calling. Die 9B-Version läuft problemlos auf Mittelklasse-Hardware.

GLM-4-9B: eigene Lizenz (kommerziell mit Registrierung); neuere GLM-4.5-Reihe: MIT♥ –⧉ –

gpt-oss (OpenAI)

OpenAIs offene Modelle (2025): starke Reasoning-Fähigkeiten mit einstellbarem Denk-Aufwand, natives Tool-Calling. Das 20B läuft dank MoE + 4-Bit erstaunlich gut auf 16-GB-Geräten.

Apache-2.0♥ –⧉ –

Qwen2.5-Coder

Der Standard fürs lokale Coden. Das 32B spielt in der Liga proprietärer Modelle; 1.5B/3B eignen sich als flotte Autocomplete-Engine im Editor (z. B. mit Continue.dev).

Apache-2.0 (0.5–32B)♥ –⧉ –

Qwen3-Coder

Nachfolger mit Fokus auf agentisches Coden (Tool-Nutzung, ganze Repos bearbeiten). Das 30B-A3B ist dank nur 3B aktiver Parameter sehr schnell.

Apache-2.0♥ –⧉ –

DeepSeek-Coder-V2

Das Lite-Modell (nur 2,4B aktiv) liefert für seine Geschwindigkeit erstaunliche Code-Qualität in 300+ Sprachen — gut für schwächere Rechner.

DeepSeek Model License (kommerziell erlaubt, mit Nutzungsauflagen)♥ –⧉ –

Codestral

Mistrals Code-Spezialist mit sehr gutem Fill-in-the-Middle, 80+ Sprachen. Wegen der Lizenz nur für private Projekte/Forschung.

Mistral Non-Production License (nicht kommerziell!)♥ –⧉ –

Devstral

Mistrals freier Coding-Agent (mit All Hands AI entwickelt), optimiert für agentische Workflows wie OpenHands — Codebasen erkunden, Multi-File-Edits.

Apache-2.0♥ –⧉ –

StarCoder2

Transparent trainiertes Community-Modell (BigCode/Hugging Face) auf 600+ Sprachen. Das 3B ist eine gute lokale Autocomplete-Engine.

BigCode OpenRAIL-M♥ –⧉ –

CodeLlama

Der Veteran (2023). Heute fast immer von Qwen2.5-Coder geschlagen — nur noch relevant, wenn man explizit darauf aufgebaute Tools nutzt.

Llama 2 Community License♥ –⧉ –

CodeGemma

Googles Code-Ableger von Gemma; das 2B ist als schnelle Completion-Engine für schwache Hardware gedacht.

Gemma Terms of Use♥ –⧉ –

DeepSeek-R1

Das Modell, das Anfang 2025 die Reasoning-Welle auslöste — o1-Klasse, komplett offen unter MIT. Lokal nutzt man praktisch immer die Distills (nächste Zeile).

MIT♥ –⧉ –

DeepSeek-R1-Distill

R1-Denkfähigkeit in Alltagsgrößen destilliert (auf Qwen-/Llama-Basis). Das 14B ist der Sweet Spot für 16-GB-Rechner, das 32B für 24-GB-GPUs.

MIT (Basis-Lizenzen von Qwen/Llama beachten)♥ –⧉ –

QwQ

Alibabas Reasoning-Spezialist: erreicht in Mathe/Logik-Benchmarks Werte nahe viel größerer Modelle. Komplett freie Lizenz.

Apache-2.0♥ –⧉ –

Qwen 3 (Thinking)

Hybrid-Ansatz: dasselbe Modell kann mit und ohne Denk-Modus antworten (umschaltbar). Praktisch, wenn man nicht zwei Modelle vorhalten will; die „-Thinking-2507"-Checkpoints sind reine Denk-Varianten.

Apache-2.0♥ –⧉ –

Phi-4-reasoning

Microsofts Beweis, dass auch 14B ernsthaft „denken" kann — stark in Mathe/Wissenschaft, MIT-frei. Gute Wahl für 16-GB-Geräte.

MIT♥ –⧉ –

Magistral

Mistrals Reasoning-Modell mit Fokus auf mehrsprachiges Denken (denkt auch auf Deutsch statt nur Englisch) und nachvollziehbare Gedankengänge.

Apache-2.0♥ –⧉ –

Ollama.20 Einträge

Ollama ([ollama.com](https://ollama.com) · [GitHub](https://github.com/ollama/ollama), MIT) ist der einfachste Weg, lokale LLMs zu betreiben. Dieser Ordner enthält: 1. Praxis-Basics (unten): die wichtigsten CLI-Befehle, ein Modelfile-Beispiel, die API-Endpoints. 2. [`pipelines/`](pipelines/): 20 kuratierte Beispiel-Pipelines aus [open-webui/pipelines](https://github.com/open-webui/pipelines) (MIT-Lizenz, Original-LICENSE liegt bei) — Plugins, die Ollama/Open WebUI um RAG, Filter, Übersetzung u. v. m. erweitern. ---

Runner-Tools.14 Einträge

Ollama

Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.

MIT♥ –⧉ –

LM Studio

Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.

Proprietär (App kostenlos, auch für Firmen; SDK/CLI: MIT)♥ –⧉ –

llama.cpp

Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.

MIT♥ –⧉ –

vLLM

Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.

Apache-2.0♥ –⧉ –

KoboldCpp

Einzel-Binary auf llama.cpp-Basis mit eigener Web-GUI; beliebt in der Rollenspiel-/Story-Community (Charaktere, Welten, lange Kontexte), kann auch Bilder (Stable Diffusion) und TTS.

AGPL-3.0 → nur Link♥ –⧉ –

Jan

Offline-ChatGPT-Alternative als schicke Desktop-App: lokale Modelle (llama.cpp) und Cloud-Anbieter in einer Oberfläche, Erweiterungen, lokaler API-Server.

Repo ohne Standard-SPDX (AGPL-basiert) → nur Link♥ –⧉ –

GPT4All

Einsteigerfreundliche Desktop-App von Nomic: kuratierte Modell-Liste, „LocalDocs" (Chat mit eigenen Dateien) eingebaut, läuft gut auf reiner CPU. Entwicklung zuletzt ruhiger.

MIT♥ –⧉ –

Open WebUI

Die beliebteste Web-Oberfläche für Ollama & OpenAI-kompatible APIs: Multi-User mit Rechten, RAG, Websuche, Bild-Generierung, Pipelines-Plugins. Perfekt als „Familien-/Team-ChatGPT" auf dem Heimserver. (Die zugehörigen Pipelines sind MIT → kuratierte Beispiele in ../Ollama/.)

Custom (Open-WebUI-Lizenz mit Branding-Klausel) → nur Link♥ –⧉ –

text-generation-webui (oobabooga)

Das „Schweizer Taschenmesser" der LLM-Web-UIs: viele Backends (llama.cpp, Transformers, ExLlama), Charaktere, Erweiterungen, Trainings-/LoRA-Funktionen. Für Bastler, die alles einstellen wollen.

AGPL-3.0 → nur Link♥ –⧉ –

LocalAI

Selbstgehosteter OpenAI-API-Ersatz für den kompletten Stack: LLMs, Embeddings, Whisper, TTS, Bild-Generierung hinter einer API — Drop-in für Apps, die „OpenAI" erwarten. Läuft auch ohne GPU.

MIT♥ –⧉ –

exo

Experimentell: mehrere Alltagsgeräte zu einem KI-Cluster zusammenschalten (Macs, PCs, sogar iPhones) — große Modelle laufen verteilt, die kein Einzelgerät stemmt.

Apache-2.0♥ –⧉ –

Khoj

Selbstgehosteter KI-Assistent für die eigenen Notizen/Dokumente (Obsidian, Markdown, PDF, Notion): semantische Suche + Chat, auch mit lokalen Modellen als Backend.

AGPL-3.0 → nur Link♥ –⧉ –

AnythingLLM

Eine All-in-One-Desktop-App, die lokale oder Cloud-Modelle mit einer eingebauten Dokumenten-Datenbank verbindet — Arbeitsbereiche, RAG und Chat in einem Fenster.

MIT♥ –⧉ –

LibreChat

Eine quelloffene, selbst gehostete Chat-Oberfläche, die viele Modelle unter einem Dach vereint — Cloud-Anbieter und lokale Modelle nebeneinander, mit Nutzerverwaltung.

MIT♥ –⧉ –

RAG-Werkzeuge.3 Einträge

PrivateGPT

Befrage deine eigenen Dokumente mit KI — zu 100 % offline. PrivateGPT liest deine PDFs und Texte ein und beantwortet Fragen dazu, ohne dass ein Byte das Gerät verlässt.

Apache-2.0♥ –⧉ –

Onyx (früher Danswer)

Eine selbst gehostete KI-Suche fürs Team: verbindet sich mit euren Wissensquellen (Dateien, Wikis, Chats) und beantwortet Fragen quer über alles — mit Quellenangabe.

MIT (Community Edition)♥ –⧉ –

RAGFlow

Eine RAG-Engine mit besonders starkem Dokumentenverständnis: zerlegt auch komplexe PDFs mit Tabellen und Layout sauber — für präzise, belegte Antworten.

Apache-2.0♥ –⧉ –

Etwas fehlt in dieser Kategorie?

Reichen Sie eigene Skills, Agenten oder Fundstücke ein — nach Prüfung erscheinen sie hier mit Namensnennung.

Eintrag einreichen