machichdigital
ModellLokale LLM-ModelleLizenz: Apache-2.0 (7B/32B); 3B/72B eigene Lizenzen

Qwen2.5-VL

Aktuell die Referenz für lokales Dokumenten-Verständnis: exzellente OCR (auch Handschrift/Tabellen), versteht Videos, kann Objekte lokalisieren.

× kopiert× heruntergeladenBewertung:

Aktuell die Referenz für lokales Dokumenten-Verständnis: exzellente OCR (auch Handschrift/Tabellen), versteht Videos, kann Objekte lokalisieren.

So nutzt du es

Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).

Größen & Hardware

  • Verfügbare Größen: 3B / 7B / 32B / 72B
  • Empfohlene Hardware (Q4): 7B: 10 GB · 32B: 24–32 GB

Im Detail

Qwen2.5-VL ist derzeit eines der leistungsfähigsten offenen Vision-Modelle für den lokalen Einsatz. Besonders stark ist die OCR: Es liest nicht nur gedruckten Text zuverlässig, sondern kommt auch mit Handschrift und komplexen Tabellenstrukturen zurecht – nützlich für Rechnungsverarbeitung, Formularauswertung oder Dokumenten-Digitalisierung. Zusätzlich versteht es Videos über mehrere Frames hinweg und kann Objekte im Bild präzise lokalisieren, was es auch für Bildanalyse-Pipelines interessant macht. Für reine Text-Chats ist es nicht nötig, aber überall dort, wo Bilder, Screenshots oder Scans ausgewertet werden sollen, gehört es zu den ersten Wahlen unter offenen Modellen. Die 7B-Größe ist ein guter Kompromiss zwischen Tempo und Genauigkeit.

Praxis-Tipp

Für Rechnungs- oder Belegverarbeitung ein gescanntes Dokument einreichen mit dem Prompt ‘Extrahiere Datum, Betrag und Rechnungsnummer als JSON’ – die OCR-Qualität ist auch bei schlechten Scans meist ausreichend.

Siehe auch

Lizenz & Quelle

  • Lizenz: Apache-2.0 (7B/32B); 3B/72B eigene Lizenzen
  • Quelle: Ollama
  • Quelle: HF

Erfahrungen & Kommentare.

Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Llama 3.1

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

Llama 3.1 Community License

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)