Qwen2.5-VL
Aktuell die Referenz für lokales Dokumenten-Verständnis: exzellente OCR (auch Handschrift/Tabellen), versteht Videos, kann Objekte lokalisieren.
Aktuell die Referenz für lokales Dokumenten-Verständnis: exzellente OCR (auch Handschrift/Tabellen), versteht Videos, kann Objekte lokalisieren.
So nutzt du es
Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).
Größen & Hardware
- Verfügbare Größen: 3B / 7B / 32B / 72B
- Empfohlene Hardware (Q4): 7B: 10 GB · 32B: 24–32 GB
Im Detail
Qwen2.5-VL ist derzeit eines der leistungsfähigsten offenen Vision-Modelle für den lokalen Einsatz. Besonders stark ist die OCR: Es liest nicht nur gedruckten Text zuverlässig, sondern kommt auch mit Handschrift und komplexen Tabellenstrukturen zurecht – nützlich für Rechnungsverarbeitung, Formularauswertung oder Dokumenten-Digitalisierung. Zusätzlich versteht es Videos über mehrere Frames hinweg und kann Objekte im Bild präzise lokalisieren, was es auch für Bildanalyse-Pipelines interessant macht. Für reine Text-Chats ist es nicht nötig, aber überall dort, wo Bilder, Screenshots oder Scans ausgewertet werden sollen, gehört es zu den ersten Wahlen unter offenen Modellen. Die 7B-Größe ist ein guter Kompromiss zwischen Tempo und Genauigkeit.
Praxis-Tipp
Für Rechnungs- oder Belegverarbeitung ein gescanntes Dokument einreichen mit dem Prompt ‘Extrahiere Datum, Betrag und Rechnungsnummer als JSON’ – die OCR-Qualität ist auch bei schlechten Scans meist ausreichend.
Siehe auch
Lizenz & Quelle
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
