Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Lokale Modelle heißen: keine Cloud, keine API-Kosten, volle Datenkontrolle. Dieser Bereich ist der Schwerpunkt des Verzeichnisses.
97 Einträge · alle geprüft · kostenlos
Alle 97 Einträge durchblättern →Faustregel für die übliche 4-Bit-Quantisierung: Die Modellgröße (Parameter) bestimmt den Arbeitsspeicher-Bedarf. Mehr RAM = klügere Modelle.
| Werkzeug | Bedienung | Eigene Dokumente (RAG) | Lizenz | Ideal für |
|---|---|---|---|---|
| Ollama | Terminal (+ Open WebUI) | über Zusätze | MIT | Skripte, Entwickler, Server |
| LM Studio | Fertige App | eingebaut (Chat mit Dateien) | proprietär (kostenlos) | Einsteiger, die ein Fenster wollen |
| Jan | Fertige App | eingebaut | Open Source (AGPL) | Transparenz-Fans, offline |
| GPT4All | Fertige App | eingebaut (LocalDocs) | MIT | Ältere/schwache Rechner |
| Open WebUI | Browser (über Ollama) | eingebaut (Upload + Fragen) | Open Source (BSD) | ChatGPT-Gefühl im Browser |
Alle fünf stehen mit Anleitung hier im Verzeichnis (Runner-Tools) — und die Schritt-für-Schritt-Einrichtung gibt es unterLokale KI installieren.
Stand: Juli 2026. Die Modell-Landschaft bewegt sich schnell — neueste Versionen/Checkpoints immer direkt in der [Ollama-Library](https://ollama.com/library) bzw. auf [Hugging Face](https://huggingface.co/models) nachschlagen. ---
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
Alibabas Arbeitspferd: stark in vielen Sprachen (auch Deutsch), Mathe und strukturierten Ausgaben (JSON). Die Apache-Größen sind auch kommerziell völlig frei.
Aktuelle Qwen-Generation mit umschaltbarem „Thinking"-Modus (überlegt vor der Antwort). Das MoE 30B-A3B ist ein Geheimtipp: 30B-Qualität bei Geschwindigkeit eines kleinen Modells.
Der Klassiker unter den freien 7B-Modellen: schnell, genügsam, gute Basis für Feintuning. Inzwischen von Neuerem überholt, aber weiterhin grundsolide.
Sehr starkes, komplett freies Mittelklasse-Modell aus Europa; neuere Versionen auch mit Bildverständnis. Top-Wahl für 32-GB-Macs und RTX-3090/4090-Besitzer.
Gemeinsam mit NVIDIA entwickelt, 128K Kontext, ausdrücklich mehrsprachig (gutes Deutsch). Guter Mittelweg zwischen 7B und 24B.
Mistrals Edge-Reihe für Geräte-nahe Anwendungen. Wegen der Research-Lizenz nur für private/Forschungszwecke frei.
Der MoE-Pionier von Ende 2023. Heute meist durch Qwen 3 MoE oder Mistral Small ersetzt, aber lizenzrechtlich völlig frei.
Googles Vorgänger-Generation, immer noch beliebt: 9B schreibt angenehm natürliche Texte, auch auf Deutsch.
Googles aktuelle offene Reihe: ab 4B multimodal (versteht Bilder), 128K Kontext, über 100 Sprachen. 12B ist ein exzellenter Allrounder für 16-GB-Rechner.
Microsofts „klein aber schlau"-Reihe: mit synthetischen Lehrbuch-Daten trainiert, überraschend stark in Mathe/Logik. MIT-Lizenz = maximal frei.
Eines der stärksten offenen Modelle überhaupt — GPT-4-Klasse. Lokal nur mit Server-Hardware realistisch; für Normalos sind die R1-Distills (s. Reasoning) der Weg.
Chinesische Alternative mit gutem Multilingual-Support und Tool-Calling. Die 9B-Version läuft problemlos auf Mittelklasse-Hardware.
OpenAIs offene Modelle (2025): starke Reasoning-Fähigkeiten mit einstellbarem Denk-Aufwand, natives Tool-Calling. Das 20B läuft dank MoE + 4-Bit erstaunlich gut auf 16-GB-Geräten.
Der Standard fürs lokale Coden. Das 32B spielt in der Liga proprietärer Modelle; 1.5B/3B eignen sich als flotte Autocomplete-Engine im Editor (z. B. mit Continue.dev).
Nachfolger mit Fokus auf agentisches Coden (Tool-Nutzung, ganze Repos bearbeiten). Das 30B-A3B ist dank nur 3B aktiver Parameter sehr schnell.
Das Lite-Modell (nur 2,4B aktiv) liefert für seine Geschwindigkeit erstaunliche Code-Qualität in 300+ Sprachen — gut für schwächere Rechner.
Mistrals Code-Spezialist mit sehr gutem Fill-in-the-Middle, 80+ Sprachen. Wegen der Lizenz nur für private Projekte/Forschung.
Mistrals freier Coding-Agent (mit All Hands AI entwickelt), optimiert für agentische Workflows wie OpenHands — Codebasen erkunden, Multi-File-Edits.
Transparent trainiertes Community-Modell (BigCode/Hugging Face) auf 600+ Sprachen. Das 3B ist eine gute lokale Autocomplete-Engine.
Der Veteran (2023). Heute fast immer von Qwen2.5-Coder geschlagen — nur noch relevant, wenn man explizit darauf aufgebaute Tools nutzt.
Googles Code-Ableger von Gemma; das 2B ist als schnelle Completion-Engine für schwache Hardware gedacht.
Das Modell, das Anfang 2025 die Reasoning-Welle auslöste — o1-Klasse, komplett offen unter MIT. Lokal nutzt man praktisch immer die Distills (nächste Zeile).
R1-Denkfähigkeit in Alltagsgrößen destilliert (auf Qwen-/Llama-Basis). Das 14B ist der Sweet Spot für 16-GB-Rechner, das 32B für 24-GB-GPUs.
Alibabas Reasoning-Spezialist: erreicht in Mathe/Logik-Benchmarks Werte nahe viel größerer Modelle. Komplett freie Lizenz.
Hybrid-Ansatz: dasselbe Modell kann mit und ohne Denk-Modus antworten (umschaltbar). Praktisch, wenn man nicht zwei Modelle vorhalten will; die „-Thinking-2507"-Checkpoints sind reine Denk-Varianten.
Microsofts Beweis, dass auch 14B ernsthaft „denken" kann — stark in Mathe/Wissenschaft, MIT-frei. Gute Wahl für 16-GB-Geräte.
Mistrals Reasoning-Modell mit Fokus auf mehrsprachiges Denken (denkt auch auf Deutsch statt nur Englisch) und nachvollziehbare Gedankengänge.
Ollama ([ollama.com](https://ollama.com) · [GitHub](https://github.com/ollama/ollama), MIT) ist der einfachste Weg, lokale LLMs zu betreiben. Dieser Ordner enthält: 1. Praxis-Basics (unten): die wichtigsten CLI-Befehle, ein Modelfile-Beispiel, die API-Endpoints. 2. [`pipelines/`](pipelines/): 20 kuratierte Beispiel-Pipelines aus [open-webui/pipelines](https://github.com/open-webui/pipelines) (MIT-Lizenz, Original-LICENSE liegt bei) — Plugins, die Ollama/Open WebUI um RAG, Filter, Übersetzung u. v. m. erweitern. ---
Minimalbeispiel: Anfragen an einen Ollama-Server durchreichen — der beste Startpunkt, um das Pipeline-Prinzip zu verstehen.
„Manifold": macht alle auf dem Ollama-Server installierten Modelle auf einmal verfügbar statt nur eines.
GGUF-Modelle direkt über die llama-cpp-python-Bibliothek fahren — ohne Ollama dazwischen.
Apple-Silicon-Spezialist: Modelle über Apples MLX-Framework serven (schnell auf M-Chips).
Das Basis-Rezept für lokales RAG: Dokumente aus einem Ordner indexieren (LlamaIndex) und mit lokalem Ollama-Modell + lokalen Embeddings befragen.
Wie oben, aber die Wissensbasis ist ein GitHub-Repo — „Chat mit der Codebase".
Natürliche Sprache → SQL-Abfrage gegen die eigene Datenbank, ausgeführt mit lokalem Modell.
Gleiches RAG-Prinzip mit dem Haystack-Framework (deutsche Firma deepset) statt LlamaIndex.
Leitet Anfragen mit Bildern automatisch an ein Vision-Modell (z. B. llava) um — Text-Modell und Bild-Modell wirken wie eines.
Übersetzt Nutzer-Eingabe und Antwort per (lokalem) LLM — z. B. Deutsch fragen, englisch-starkes Modell nutzen, Deutsch antworten.
Dasselbe mit selbstgehostetem LibreTranslate statt LLM — deterministisch und schnell.
Begrenzung der Anfragen pro Nutzer/Zeitraum — wichtig, wenn Familie/Team auf denselben Heimserver zugreifen.
Erkennt toxische Nachrichten (lokales Detoxify-Modell) und blockt sie vor dem LLM.
Begrenzt die Zahl der Gesprächsrunden pro Chat — simples, gut lesbares Filter-Beispiel.
Tool-/Function-Calling nachrüsten: LLM darf Python-Funktionen aufrufen (Beispiel: Wetter, Rechner).
Anbindung an Home Assistant — Grundlage für den lokalen Smart-Home-Sprachassistenten.
„Modell", das eingegebenen Python-Code ausführt und das Ergebnis zurückgibt (Vorsicht: nur lokal/sandboxed nutzen!).
Minimal-Beispiel für externe Datenquellen: Anfrage → Wikipedia-API → Antwort.
Leeres Gerüst für eine eigene Pipe — hier eigene Ideen eintragen.
Leeres Gerüst für einen eigenen Filter (inlet/outlet).
Der De-facto-Standard. Modelle mit einem Befehl laden und ausführen (ollama run llama3.1), integrierte Modell-Library, OpenAI-kompatible API auf Port 11434. Basis für unzählige andere Tools.
Die komfortabelste Desktop-GUI: Modelle aus Hugging Face suchen, laden, chatten, Parameter per Regler, RAG per Drag-and-drop, lokaler OpenAI-API-Server. MLX-Support auf Apple Silicon.
Die Engine unter fast allem (Ollama, LM Studio, …): C/C++-Inferenz für GGUF-Modelle auf CPU und jeder GPU (CUDA, Metal, Vulkan, ROCm). Wer direkt damit arbeitet, bekommt maximale Kontrolle und die neuesten Features zuerst.
Produktions-Inferenz-Server mit sehr hohem Durchsatz (PagedAttention, Continuous Batching). Erste Wahl, wenn viele Nutzer/Anfragen parallel auf eine GPU-Maschine sollen. Kein Tool für den Laptop-Alltag.
Einzel-Binary auf llama.cpp-Basis mit eigener Web-GUI; beliebt in der Rollenspiel-/Story-Community (Charaktere, Welten, lange Kontexte), kann auch Bilder (Stable Diffusion) und TTS.
Offline-ChatGPT-Alternative als schicke Desktop-App: lokale Modelle (llama.cpp) und Cloud-Anbieter in einer Oberfläche, Erweiterungen, lokaler API-Server.
Einsteigerfreundliche Desktop-App von Nomic: kuratierte Modell-Liste, „LocalDocs" (Chat mit eigenen Dateien) eingebaut, läuft gut auf reiner CPU. Entwicklung zuletzt ruhiger.
Die beliebteste Web-Oberfläche für Ollama & OpenAI-kompatible APIs: Multi-User mit Rechten, RAG, Websuche, Bild-Generierung, Pipelines-Plugins. Perfekt als „Familien-/Team-ChatGPT" auf dem Heimserver. (Die zugehörigen Pipelines sind MIT → kuratierte Beispiele in ../Ollama/.)
Das „Schweizer Taschenmesser" der LLM-Web-UIs: viele Backends (llama.cpp, Transformers, ExLlama), Charaktere, Erweiterungen, Trainings-/LoRA-Funktionen. Für Bastler, die alles einstellen wollen.
Selbstgehosteter OpenAI-API-Ersatz für den kompletten Stack: LLMs, Embeddings, Whisper, TTS, Bild-Generierung hinter einer API — Drop-in für Apps, die „OpenAI" erwarten. Läuft auch ohne GPU.
Experimentell: mehrere Alltagsgeräte zu einem KI-Cluster zusammenschalten (Macs, PCs, sogar iPhones) — große Modelle laufen verteilt, die kein Einzelgerät stemmt.
Selbstgehosteter KI-Assistent für die eigenen Notizen/Dokumente (Obsidian, Markdown, PDF, Notion): semantische Suche + Chat, auch mit lokalen Modellen als Backend.
Eine All-in-One-Desktop-App, die lokale oder Cloud-Modelle mit einer eingebauten Dokumenten-Datenbank verbindet — Arbeitsbereiche, RAG und Chat in einem Fenster.
Eine quelloffene, selbst gehostete Chat-Oberfläche, die viele Modelle unter einem Dach vereint — Cloud-Anbieter und lokale Modelle nebeneinander, mit Nutzerverwaltung.
Befrage deine eigenen Dokumente mit KI — zu 100 % offline. PrivateGPT liest deine PDFs und Texte ein und beantwortet Fragen dazu, ohne dass ein Byte das Gerät verlässt.
Eine selbst gehostete KI-Suche fürs Team: verbindet sich mit euren Wissensquellen (Dateien, Wikis, Chats) und beantwortet Fragen quer über alles — mit Quellenangabe.
Eine RAG-Engine mit besonders starkem Dokumentenverständnis: zerlegt auch komplexe PDFs mit Tabellen und Layout sauber — für präzise, belegte Antworten.
Etwas fehlt in dieser Kategorie?
Reichen Sie eigene Skills, Agenten oder Fundstücke ein — nach Prüfung erscheinen sie hier mit Namensnennung.
Eintrag einreichen