Lokale LLMs · Foto: derekGavey, CC BY 2.0
Mistral NeMo
Zuletzt aktualisiert:
Typ
Modell
Lizenz
Apache-2.0
Quelle
Anwendungsfeld
Lokale LLM-Modelle
Voraussetzungen
Keine besonderen — direkt loslegen.
Gemeinsam mit NVIDIA entwickelt, 128K Kontext, ausdrücklich mehrsprachig (gutes Deutsch). Guter Mittelweg zwischen 7B und 24B.
So nutzt du es
Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).
Größen & Hardware
- Verfügbare Größen: 12B
- Empfohlene Hardware (Q4): 12–16 GB
Benutzungsanleitung
Gemeinsam mit Nvidia entwickeltes 12B-Modell — der beste Mistral-Einstieg für 16-GB-Rechner.
Installation:
ollama run mistral-nemo
~7 GB Download, ab 12–16 GB RAM angenehm.
Wofür gut: Lange Kontexte (128k), sauberes Deutsch, Alltag + leichte Analyse. Apache-2.0.
Erster Test: ein längeres Dokument einfügen und gezielt Fragen dazu stellen — NeMo hält den Faden auch über viele Seiten.
Im Detail
Mistral NeMo ist ein 12-Milliarden-Parameter-Modell, das Mistral gemeinsam mit NVIDIA entwickelt hat und das mit 128K Tokens Kontext einen für seine Größe außergewöhnlich langen Speicher mitbringt. Anders als viele US-zentrierte Modelle wurde es ausdrücklich mehrsprachig trainiert, Deutsch funktioniert entsprechend spürbar zuverlässiger als bei reinen Englisch-Modellen ähnlicher Größe. Es positioniert sich als Mittelweg: deutlich fähiger als 7B-Modelle wie Mistral 7B, aber genügsamer im Speicherbedarf als 24B-Modelle wie Mistral Small. Für 12-16 GB VRAM/RAM ist es damit eine der stärksten Optionen für Allround-Chat und Assistenzaufgaben.
Praxis-Tipp
Bei deutschsprachigen Assistenz-Aufgaben mit langen Dokumenten (z. B. “Fasse dieses 40-seitige PDF auf Deutsch zusammen”) profitieren Sie besonders vom 128K-Kontext.
Siehe auch
Lizenz & Quelle
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
