Lokale LLMs · Foto: derekGavey, CC BY 2.0
MiniCPM-V
Zuletzt aktualisiert:
Typ
Modell
Lizenz
Apache-2.0 (Code); Gewichte: MiniCPM-Lizenz (kommerziell nach kostenloser Registrierung)
Quelle
Anwendungsfeld
Lokale LLM-Modelle
Voraussetzungen
Keine besonderen — direkt loslegen.
„GPT-4V-Niveau auf dem Handy“ ist der Anspruch: sehr effizient, starke OCR, versteht auch Video-Frames. Top für schwächere Hardware.
So nutzt du es
Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).
Größen & Hardware
- Verfügbare Größen: ~8B
- Empfohlene Hardware (Q4): 8–10 GB
Im Detail
MiniCPM-V verfolgt den Anspruch, mit rund 8 Milliarden Parametern Bildverständnis nahe an großen Modellen wie GPT-4V zu liefern – bei einem Bruchteil des Ressourcenbedarfs von 8–10 GB. Besonders stark ist die Texterkennung (OCR) in Bildern, etwa bei Dokumenten, Schildern oder Screenshots, wo ältere offene Vision-Modelle wie LLaVA öfter Fehler machen. Zusätzlich kann es einzelne Frames aus Videos auswerten, was für kurze Videoanalysen nützlich ist. Der große Vorteil liegt in der Effizienz: Wer keine High-End-GPU besitzt, bekommt hier brauchbare multimodale Fähigkeiten, die auf leistungsschwächerer Hardware noch praktikabel laufen. Für sehr anspruchsvolle Bildanalysen mit vielen Details bleiben größere Modelle dennoch überlegen.
Praxis-Tipp
Testen Sie MiniCPM-V gezielt an Dokumentfotos oder Screenshots mit Text, etwa „Lies mir den Text auf diesem Foto vor“ – hier zeigt sich sein OCR-Vorteil am deutlichsten.
Siehe auch
Lizenz & Quelle
Erfahrungen & Kommentare.
Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
Llama 3.1
Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.
Llama 3.3
Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.
Llama 4 (Scout / Maverick)
Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.
