machichdigital

Lokale LLMs · Foto: derekGavey, CC BY 2.0

ModellLokale LLM-ModelleLizenz: Apache-2.0 (7B/32B); 3B/72B eigene Lizenzen

Qwen2.5-VL

Zuletzt aktualisiert:

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Modell

Lizenz

Apache-2.0 (7B/32B); 3B/72B eigene Lizenzen

Anwendungsfeld

Lokale LLM-Modelle

Voraussetzungen

Keine besonderen — direkt loslegen.

Aktuell die Referenz für lokales Dokumenten-Verständnis: exzellente OCR (auch Handschrift/Tabellen), versteht Videos, kann Objekte lokalisieren.

So nutzt du es

Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).

Größen & Hardware

  • Verfügbare Größen: 3B / 7B / 32B / 72B
  • Empfohlene Hardware (Q4): 7B: 10 GB · 32B: 24–32 GB

Im Detail

Qwen2.5-VL ist ein multimodales Modell, das Bilder, Dokumente und Videos versteht statt nur Text. Die große Stärke liegt in der Texterkennung: Es liest gedruckte und handschriftliche Inhalte sowie komplexe Tabellen aus Scans und Fotos zuverlässig aus und liefert strukturierte Ergebnisse. Zusätzlich kann es Objekte in Bildern lokalisieren und längere Videos inhaltlich zusammenfassen. Für lokale Dokumentenverarbeitung, etwa Rechnungen, Formulare oder gescannte Verträge, zählt es aktuell zu den besten offenen Alternativen zu Cloud-OCR-Diensten. Die 7B-Version läuft schon mit rund 10 GB Speicher auf normaler Hardware, für anspruchsvollere Layouts oder höhere Genauigkeit lohnen sich die größeren 32B- und 72B-Varianten.

Praxis-Tipp

Für die Digitalisierung von Belegen reicht meist schon die 7B-Variante: Prompt wie „Extrahiere alle Tabellenwerte aus diesem Scan als JSON“ direkt auf ein Foto oder PDF anwenden.

Siehe auch

Lizenz & Quelle

  • Lizenz: Apache-2.0 (7B/32B); 3B/72B eigene Lizenzen
  • Quelle: Ollama
  • Quelle: HF

Erfahrungen & Kommentare.

Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Llama 3.1

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

Llama 3.1 Community License♥ –⧉ –

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License♥ –⧉ –

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)♥ –⧉ –