Lokale LLMs · Foto: derekGavey, CC BY 2.0
LLaVA
Zuletzt aktualisiert:
Typ
Modell
Lizenz
Apache-2.0 (Code); Basis-Modell-Lizenz (Llama/Vicuna) beachten
Quelle
Anwendungsfeld
Lokale LLM-Modelle
Voraussetzungen
Keine besonderen — direkt loslegen.
Der Open-Source-Vision-Pionier, in jedem Tool unterstützt. Gut für allgemeine Bildbeschreibung; bei Text im Bild sind Neuere besser.
So nutzt du es
Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).
Größen & Hardware
- Verfügbare Größen: 7B / 13B / 34B
- Empfohlene Hardware (Q4): 7B: 8 GB
Im Detail
LLaVA war eines der ersten offenen Modelle, das Sprachmodelle mit Bildverständnis verband, und wird deshalb von praktisch jedem lokalen KI-Tool (Ollama, LM Studio, Open WebUI) direkt unterstützt – ein großer Pluspunkt für Kompatibilität. In Größen von 7B bis 34B verfügbar, reicht schon die kleine Variante mit rund 8 GB Speicherbedarf für einfache Bildbeschreibungen, Szenenanalysen oder Bildunterschriften. Wo LLaVA schwächelt, ist bei Text innerhalb von Bildern (OCR) und bei feinen Details – hier liefern neuere Vision-Modelle deutlich genauere Ergebnisse. Für Einsteiger, die schnell mit lokaler Bildanalyse experimentieren wollen, bleibt LLaVA wegen der breiten Tool-Unterstützung trotzdem ein guter erster Zugang.
Praxis-Tipp
Nutzen Sie LLaVA für schnelle Alltagsbeschreibungen wie „Was ist auf diesem Foto zu sehen?“ – für Rechnungen oder Screenshots mit viel Text greifen Sie besser zu einem neueren OCR-starken Modell.
Siehe auch
Lizenz & Quelle
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
