Lokale LLMs · Foto: derekGavey, CC BY 2.0
Mistral Small 4
Typ
Modell
Lizenz
Apache-2.0
Quelle
Anwendungsfeld
Lokale LLM-Modelle
Teams mit eigener GPU-Maschine, die ein schnelles, frei nutzbares Allround-Modell suchen.
Voraussetzungen
Keine besonderen — direkt loslegen.
Mixture-of-Experts-Modell mit 119 Mrd. Parametern, von denen je Token nur 6,5 Mrd. rechnen: Anweisungen, Reasoning, Agenten und Bilder in einem Modell, Apache-2.0.
Für wen: Teams mit eigener GPU-Maschine, die ein schnelles, frei nutzbares Allround-Modell suchen.
Installation
Ohne eigene Hardware: über die Mistral-API (EU-Hosting, Konto auf console.mistral.ai) oder im Chat-Assistenten Vibe (chat.mistral.ai). Selbst betreiben: laut Model Card mit vLLM auf 2 GPUs (Tensor-Parallel 2).
Erste Schritte
Weil nur 6,5 Mrd. Parameter pro Token aktiv sind, antwortet Small 4 deutlich schneller, als die Gesamtgröße vermuten lässt. Mozilla bindet es seit September 2026 als wählbares Modell in das Firefox-„Smart Window“ ein (zunächst USA/Kanada, Deutschland laut Mozilla später).
Plattformen: Linux-Server mit GPUs (vLLM) · API
Lizenz & Quelle
- Lizenz: Apache-2.0
- Quelle: HF
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
