machichdigital

Lokale LLMs — Modelle, Ollama & Runner.

Lokale Modelle heißen: keine Cloud, keine API-Kosten, volle Datenkontrolle. Dieser Bereich ist der Schwerpunkt des Verzeichnisses.

97 Einträge · alle geprüft · kostenlos

Alle 97 Einträge durchblättern →

Welches Modell passt in Ihren Rechner?

Faustregel für die übliche 4-Bit-Quantisierung: Die Modellgröße (Parameter) bestimmt den Arbeitsspeicher-Bedarf. Mehr RAM = klügere Modelle.

3–4B6 GB RAMz. B. Llama 3.2, Gemma 3 4B, Qwen 3 4B7–8B8 GB RAMz. B. Mistral 7B, Llama 3.1 8B12–14B16 GB RAMz. B. Mistral NeMo, Qwen 2.5 14B27–34B32 GB RAMz. B. Gemma 3 27B, Qwen 3 32B70B64 GB RAMz. B. Llama 3.3 70B

Und womit ausführen? Die Runner im Vergleich.

WerkzeugBedienungEigene Dokumente (RAG)LizenzIdeal für
OllamaTerminal (+ Open WebUI)über ZusätzeMITSkripte, Entwickler, Server
LM StudioFertige Appeingebaut (Chat mit Dateien)proprietär (kostenlos)Einsteiger, die ein Fenster wollen
JanFertige AppeingebautOpen Source (AGPL)Transparenz-Fans, offline
GPT4AllFertige Appeingebaut (LocalDocs)MITÄltere/schwache Rechner
Open WebUIBrowser (über Ollama)eingebaut (Upload + Fragen)Open Source (BSD)ChatGPT-Gefühl im Browser

Alle fünf stehen mit Anleitung hier im Verzeichnis (Runner-Tools) — und die Schritt-für-Schritt-Einrichtung gibt es unterLokale KI installieren.

Lokale LLM-Modelle.60 Einträge

Stand: Juli 2026. Die Modell-Landschaft bewegt sich schnell — neueste Versionen/Checkpoints immer direkt in der [Ollama-Library](https://ollama.com/library) bzw. auf [Hugging Face](https://huggingface.co/models) nachschlagen. ---

Llama 3.1

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

Llama 3.1 Community License

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)

Qwen 2.5

Alibabas Arbeitspferd: stark in vielen Sprachen (auch Deutsch), Mathe und strukturierten Ausgaben (JSON). Die Apache-Größen sind auch kommerziell völlig frei.

Apache-2.0 (7B/14B/32B); 3B + 72B: eigene Qwen-Lizenz

Qwen 3

Aktuelle Qwen-Generation mit umschaltbarem „Thinking"-Modus (überlegt vor der Antwort). Das MoE 30B-A3B ist ein Geheimtipp: 30B-Qualität bei Geschwindigkeit eines kleinen Modells.

Apache-2.0

Mistral 7B

Der Klassiker unter den freien 7B-Modellen: schnell, genügsam, gute Basis für Feintuning. Inzwischen von Neuerem überholt, aber weiterhin grundsolide.

Apache-2.0

Mistral Small 3.x

Sehr starkes, komplett freies Mittelklasse-Modell aus Europa; neuere Versionen auch mit Bildverständnis. Top-Wahl für 32-GB-Macs und RTX-3090/4090-Besitzer.

Apache-2.0

Mistral NeMo

Gemeinsam mit NVIDIA entwickelt, 128K Kontext, ausdrücklich mehrsprachig (gutes Deutsch). Guter Mittelweg zwischen 7B und 24B.

Apache-2.0

Ministral

Mistrals Edge-Reihe für Geräte-nahe Anwendungen. Wegen der Research-Lizenz nur für private/Forschungszwecke frei.

Mistral Research License (8B — nicht kommerziell, Lizenz prüfen!)

Mixtral

Der MoE-Pionier von Ende 2023. Heute meist durch Qwen 3 MoE oder Mistral Small ersetzt, aber lizenzrechtlich völlig frei.

Apache-2.0

Gemma 2

Googles Vorgänger-Generation, immer noch beliebt: 9B schreibt angenehm natürliche Texte, auch auf Deutsch.

Gemma Terms of Use

Gemma 3

Googles aktuelle offene Reihe: ab 4B multimodal (versteht Bilder), 128K Kontext, über 100 Sprachen. 12B ist ein exzellenter Allrounder für 16-GB-Rechner.

Gemma Terms of Use

Phi-4

Microsofts „klein aber schlau"-Reihe: mit synthetischen Lehrbuch-Daten trainiert, überraschend stark in Mathe/Logik. MIT-Lizenz = maximal frei.

MIT

DeepSeek-V3 / V3.x

Eines der stärksten offenen Modelle überhaupt — GPT-4-Klasse. Lokal nur mit Server-Hardware realistisch; für Normalos sind die R1-Distills (s. Reasoning) der Weg.

MIT (neuere Checkpoints; ältere: DeepSeek Model License)

GLM-4

Chinesische Alternative mit gutem Multilingual-Support und Tool-Calling. Die 9B-Version läuft problemlos auf Mittelklasse-Hardware.

GLM-4-9B: eigene Lizenz (kommerziell mit Registrierung); neuere GLM-4.5-Reihe: MIT

gpt-oss (OpenAI)

OpenAIs offene Modelle (2025): starke Reasoning-Fähigkeiten mit einstellbarem Denk-Aufwand, natives Tool-Calling. Das 20B läuft dank MoE + 4-Bit erstaunlich gut auf 16-GB-Geräten.

Apache-2.0

Qwen2.5-Coder

Der Standard fürs lokale Coden. Das 32B spielt in der Liga proprietärer Modelle; 1.5B/3B eignen sich als flotte Autocomplete-Engine im Editor (z. B. mit Continue.dev).

Apache-2.0 (0.5–32B)

Qwen3-Coder

Nachfolger mit Fokus auf agentisches Coden (Tool-Nutzung, ganze Repos bearbeiten). Das 30B-A3B ist dank nur 3B aktiver Parameter sehr schnell.

Apache-2.0

DeepSeek-Coder-V2

Das Lite-Modell (nur 2,4B aktiv) liefert für seine Geschwindigkeit erstaunliche Code-Qualität in 300+ Sprachen — gut für schwächere Rechner.

DeepSeek Model License (kommerziell erlaubt, mit Nutzungsauflagen)

Codestral

Mistrals Code-Spezialist mit sehr gutem Fill-in-the-Middle, 80+ Sprachen. Wegen der Lizenz nur für private Projekte/Forschung.

Mistral Non-Production License (nicht kommerziell!)

Devstral

Mistrals freier Coding-Agent (mit All Hands AI entwickelt), optimiert für agentische Workflows wie OpenHands — Codebasen erkunden, Multi-File-Edits.

Apache-2.0

StarCoder2

Transparent trainiertes Community-Modell (BigCode/Hugging Face) auf 600+ Sprachen. Das 3B ist eine gute lokale Autocomplete-Engine.

BigCode OpenRAIL-M

CodeLlama

Der Veteran (2023). Heute fast immer von Qwen2.5-Coder geschlagen — nur noch relevant, wenn man explizit darauf aufgebaute Tools nutzt.

Llama 2 Community License

CodeGemma

Googles Code-Ableger von Gemma; das 2B ist als schnelle Completion-Engine für schwache Hardware gedacht.

Gemma Terms of Use

DeepSeek-R1

Das Modell, das Anfang 2025 die Reasoning-Welle auslöste — o1-Klasse, komplett offen unter MIT. Lokal nutzt man praktisch immer die Distills (nächste Zeile).

MIT

DeepSeek-R1-Distill

R1-Denkfähigkeit in Alltagsgrößen destilliert (auf Qwen-/Llama-Basis). Das 14B ist der Sweet Spot für 16-GB-Rechner, das 32B für 24-GB-GPUs.

MIT (Basis-Lizenzen von Qwen/Llama beachten)

QwQ

Alibabas Reasoning-Spezialist: erreicht in Mathe/Logik-Benchmarks Werte nahe viel größerer Modelle. Komplett freie Lizenz.

Apache-2.0

Qwen 3 (Thinking)

Hybrid-Ansatz: dasselbe Modell kann mit und ohne Denk-Modus antworten (umschaltbar). Praktisch, wenn man nicht zwei Modelle vorhalten will; die „-Thinking-2507"-Checkpoints sind reine Denk-Varianten.

Apache-2.0

Phi-4-reasoning

Microsofts Beweis, dass auch 14B ernsthaft „denken" kann — stark in Mathe/Wissenschaft, MIT-frei. Gute Wahl für 16-GB-Geräte.

MIT

Magistral

Mistrals Reasoning-Modell mit Fokus auf mehrsprachiges Denken (denkt auch auf Deutsch statt nur Englisch) und nachvollziehbare Gedankengänge.

Apache-2.0

Ollama.20 Einträge

Ollama ([ollama.com](https://ollama.com) · [GitHub](https://github.com/ollama/ollama), MIT) ist der einfachste Weg, lokale LLMs zu betreiben. Dieser Ordner enthält: 1. Praxis-Basics (unten): die wichtigsten CLI-Befehle, ein Modelfile-Beispiel, die API-Endpoints. 2. [`pipelines/`](pipelines/): 20 kuratierte Beispiel-Pipelines aus [open-webui/pipelines](https://github.com/open-webui/pipelines) (MIT-Lizenz, Original-LICENSE liegt bei) — Plugins, die Ollama/Open WebUI um RAG, Filter, Übersetzung u. v. m. erweitern. ---

Runner-Tools.14 Einträge

Ollama

Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.

MIT

LM Studio

Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.

Proprietär (App kostenlos, auch für Firmen; SDK/CLI: MIT)

llama.cpp

Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.

MIT

vLLM

Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.

Apache-2.0

KoboldCpp

Einzel-Binary auf llama.cpp-Basis mit eigener Web-GUI; beliebt in der Rollenspiel-/Story-Community (Charaktere, Welten, lange Kontexte), kann auch Bilder (Stable Diffusion) und TTS.

AGPL-3.0 → nur Link

Jan

Offline-ChatGPT-Alternative als schicke Desktop-App: lokale Modelle (llama.cpp) und Cloud-Anbieter in einer Oberfläche, Erweiterungen, lokaler API-Server.

Repo ohne Standard-SPDX (AGPL-basiert) → nur Link

GPT4All

Einsteigerfreundliche Desktop-App von Nomic: kuratierte Modell-Liste, „LocalDocs" (Chat mit eigenen Dateien) eingebaut, läuft gut auf reiner CPU. Entwicklung zuletzt ruhiger.

MIT

Open WebUI

Die beliebteste Web-Oberfläche für Ollama & OpenAI-kompatible APIs: Multi-User mit Rechten, RAG, Websuche, Bild-Generierung, Pipelines-Plugins. Perfekt als „Familien-/Team-ChatGPT" auf dem Heimserver. (Die zugehörigen Pipelines sind MIT → kuratierte Beispiele in ../Ollama/.)

Custom (Open-WebUI-Lizenz mit Branding-Klausel) → nur Link

text-generation-webui (oobabooga)

Das „Schweizer Taschenmesser" der LLM-Web-UIs: viele Backends (llama.cpp, Transformers, ExLlama), Charaktere, Erweiterungen, Trainings-/LoRA-Funktionen. Für Bastler, die alles einstellen wollen.

AGPL-3.0 → nur Link

LocalAI

Selbstgehosteter OpenAI-API-Ersatz für den kompletten Stack: LLMs, Embeddings, Whisper, TTS, Bild-Generierung hinter einer API — Drop-in für Apps, die „OpenAI" erwarten. Läuft auch ohne GPU.

MIT

exo

Experimentell: mehrere Alltagsgeräte zu einem KI-Cluster zusammenschalten (Macs, PCs, sogar iPhones) — große Modelle laufen verteilt, die kein Einzelgerät stemmt.

Apache-2.0

Khoj

Selbstgehosteter KI-Assistent für die eigenen Notizen/Dokumente (Obsidian, Markdown, PDF, Notion): semantische Suche + Chat, auch mit lokalen Modellen als Backend.

AGPL-3.0 → nur Link

AnythingLLM

Eine All-in-One-Desktop-App, die lokale oder Cloud-Modelle mit einer eingebauten Dokumenten-Datenbank verbindet — Arbeitsbereiche, RAG und Chat in einem Fenster.

MIT

LibreChat

Eine quelloffene, selbst gehostete Chat-Oberfläche, die viele Modelle unter einem Dach vereint — Cloud-Anbieter und lokale Modelle nebeneinander, mit Nutzerverwaltung.

MIT

RAG-Werkzeuge.3 Einträge

PrivateGPT

Befrage deine eigenen Dokumente mit KI — zu 100 % offline. PrivateGPT liest deine PDFs und Texte ein und beantwortet Fragen dazu, ohne dass ein Byte das Gerät verlässt.

Apache-2.0

Onyx (früher Danswer)

Eine selbst gehostete KI-Suche fürs Team: verbindet sich mit euren Wissensquellen (Dateien, Wikis, Chats) und beantwortet Fragen quer über alles — mit Quellenangabe.

MIT (Community Edition)

RAGFlow

Eine RAG-Engine mit besonders starkem Dokumentenverständnis: zerlegt auch komplexe PDFs mit Tabellen und Layout sauber — für präzise, belegte Antworten.

Apache-2.0

Etwas fehlt in dieser Kategorie?

Reichen Sie eigene Skills, Agenten oder Fundstücke ein — nach Prüfung erscheinen sie hier mit Namensnennung.

Eintrag einreichen