machichdigital
ModellLokale LLM-ModelleLizenz: Apache-2.0 (Code); Gewichte: MiniCPM-Lizenz (kommerziell nach kostenloser Registrierung)

MiniCPM-V

„GPT-4V-Niveau auf dem Handy" ist der Anspruch: sehr effizient, starke OCR, versteht auch Video-Frames. Top für schwächere Hardware.

× kopiert× heruntergeladenBewertung:

„GPT-4V-Niveau auf dem Handy“ ist der Anspruch: sehr effizient, starke OCR, versteht auch Video-Frames. Top für schwächere Hardware.

So nutzt du es

Am einfachsten per Ollama: ollama pull <modellname> und dann ollama run <modellname> — oder komfortabel mit LM Studio (grafische Oberfläche, Modell-Suche eingebaut). Die Hardware-Angaben unten beziehen sich auf die übliche 4-Bit-Quantisierung (Q4).

Größen & Hardware

  • Verfügbare Größen: ~8B
  • Empfohlene Hardware (Q4): 8–10 GB

Im Detail

MiniCPM-V ist ein kompaktes Vision-Language-Modell mit rund 8B Parametern, das gezielt auf Effizienz statt auf reine Größe setzt. Stärken sind besonders gute Texterkennung (OCR) und die Fähigkeit, auch einzelne Video-Frames zu verstehen. Der Anspruch „GPT-4V-Niveau auf dem Handy“ trifft nicht die absolute Spitzenqualität großer Multimodal-Modelle, ist aber für die Modellgröße bemerkenswert nah dran. Braucht nur 8–10 GB Speicher und läuft damit auf Hardware, auf der größere Vision-Modelle gar nicht erst starten. Ideal für Dokumenten-OCR, Bildbeschreibungen oder einfache Video-Analyse auf schwächeren Rechnern oder Laptops ohne dedizierte GPU.

Praxis-Tipp

Ideal für OCR-Aufgaben wie „Lies den Text aus diesem Foto einer Rechnung aus und gib ihn strukturiert aus“ – läuft auch auf Laptops ohne dedizierte GPU.

Siehe auch

Lizenz & Quelle

  • Lizenz: Apache-2.0 (Code); Gewichte: MiniCPM-Lizenz (kommerziell nach kostenloser Registrierung)
  • Quelle: Ollama
  • Quelle: HF

Erfahrungen & Kommentare.

Funktioniert der Modell bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.

Llama 3.1

Der Meta-Klassiker mit 128K Kontext. 8B ist ein sehr solider Allrounder für schwächere Hardware, spricht ordentlich Deutsch.

Llama 3.1 Community License

Llama 3.3

Leistet laut Meta ungefähr so viel wie das riesige 405B-Modell — der Preis-Leistungs-Tipp, wenn man 64 GB (z. B. Mac Studio) hat.

Llama 3.3 Community License

Llama 4 (Scout / Maverick)

Metas MoE-Generation mit sehr großem Kontext und Bildverständnis. Für Heim-Hardware meist zu groß — eher für Server/Mac Studio 128 GB+.

Llama 4 Community License (EU-Einschränkungen für multimodale Nutzung beachten!)