Lokale LLMs · Foto: derekGavey, CC BY 2.0
Pixtral
Zuletzt aktualisiert:
Typ
Modell
Lizenz
Apache-2.0
Quelle
Anwendungsfeld
Lokale LLM-Modelle
Voraussetzungen
Keine besonderen — direkt loslegen.
Mistrals freies Vision-Modell: verarbeitet Bilder in nativer Auflösung, mehrere Bilder pro Prompt, 128K Kontext.
So nutzt du es
Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).
Größen & Hardware
- Verfügbare Größen: 12B
- Empfohlene Hardware (Q4): 12–16 GB
Im Detail
Pixtral ist Mistrals offenes Vision-Sprachmodell, das Bilder in ihrer nativen Auflösung verarbeitet statt sie wie viele Konkurrenten vorher herunterzuskalieren – das erhält Details in Diagrammen, Screenshots und Dokumenten. Es akzeptiert mehrere Bilder in einem Prompt und bietet mit 128K Tokens viel Platz für Kontext, etwa lange Dokumente mit eingebetteten Grafiken. Mit 12B Parametern und 12–16 GB RAM-Bedarf läuft es auf einer Mittelklasse-GPU. Für Bildbeschreibung, das Auswerten von Screenshots oder OCR-nahe Aufgaben ist es eine solide freie Alternative zu GPT-4V, auch wenn es bei sehr komplexem visuellem Schlussfolgern nicht ganz mithält.
Praxis-Tipp
Mehrere Screenshots einer Web-App gleichzeitig hochladen und fragen „Was hat sich zwischen diesen beiden Ansichten verändert?“ – Pixtral vergleicht sie in einem Prompt.
Lizenz & Quelle
- Lizenz: Apache-2.0
- Quelle: HF
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
