machichdigital

Lokale LLMs · Foto: derekGavey, CC BY 2.0

AnleitungOllamaLizenz: MITfrei kopierbar

dynamic_ollama_vision_filter_pipeline.py

Zuletzt aktualisiert:

⬇ Als Datei laden

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Anleitung

Lizenz

MIT

Anwendungsfeld

Ollama

Voraussetzungen

  • Laufendes Open-WebUI-Setup
  • Lokal bereitgestelltes Vision-Modell wie LLaVA zusätzlich zum Text-Modell
  • Laufende Ollama-Instanz

Einordnung

AufwandEinrichtung & Einarbeitung2/5 · eher geringNutzenErtrag im Alltag3/5 · mittelVoraussetzungenWas vorher da sein muss3/5 · mittel1 = gering5 = hoch

Die Filterlogik selbst ist schnell eingerichtet, setzt aber ein zusätzlich laufendes Vision-Modell voraus.

Leitet Anfragen mit Bildern automatisch an ein Vision-Modell (z. B. llava) um — Text-Modell und Bild-Modell wirken wie eines.

Im Detail

Diese Filter-Pipeline erkennt automatisch, wenn eine Nachricht ein Bild enthält, und leitet die Anfrage transparent an ein Vision-Modell wie LLaVA weiter, statt sie an Ihr normales Text-Modell zu schicken. Für Nutzerinnen und Nutzer verschwimmt dadurch der Unterschied zwischen Text- und Bildmodell zu einer einzigen Chat-Oberfläche – ein manuelles Umschalten entfällt, wenn mal ein Foto beschrieben werden soll. Praktisch für Open-WebUI-Setups, in denen ein schnelles, spezialisiertes Textmodell als Standard läuft, aber gelegentlich Bildverständnis gebraucht wird, ohne dauerhaft ein größeres multimodales Modell vorzuhalten.

Schritt für Schritt

  1. Vision-Modell wie LLaVA zusätzlich zum bestehenden Text-Modell in Ollama bereitstellen.
  2. Filter-Pipeline in Open-WebUI aktivieren.
  3. Testnachricht mit Bild senden und prüfen, ob automatisch ans Vision-Modell weitergeleitet wird.
  4. Normale Textanfragen parallel testen, um sicherzustellen, dass sie weiterhin ans Standard-Textmodell gehen.
  5. Bei Bedarf festlegen, ob das Vision-Modell dauerhaft geladen bleibt oder nur bei Bedarf gestartet wird.

Beispiel aus der Praxis

Jemand schickt im gewohnten Chat ein Foto eines defekten Geräteteils mit der Frage, was das sei; die Pipeline erkennt das Bild automatisch und lässt LLaVA statt des Text-Modells antworten, ohne dass manuell umgeschaltet werden muss.

Praxis-Tipp

Prüfen Sie vorab mit ollama list, ob das gewünschte Vision-Modell (z. B. llava oder llama3.2-vision) bereits lokal vorliegt, sonst schlägt die automatische Umleitung beim ersten Bild-Upload fehl.

Stolperfallen

Wird kein Vision-Modell wie LLaVA lokal bereitgestellt, läuft die Weiterleitung ins Leere - die Pipeline erkennt Bilder nur, das Bildverständnis liefert sie nicht selbst.

Siehe auch

Lizenz & Quelle

Häufige Fragen.

Muss ich manuell zwischen Text- und Bildmodell wechseln?

Nein, genau das übernimmt die Pipeline automatisch, sobald eine Nachricht ein Bild enthält.

Brauche ich dauerhaft ein großes multimodales Modell?

Nein, ein schnelles Textmodell kann als Standard laufen, das Vision-Modell wird nur bei Bildern hinzugezogen.

Für welche Umgebung ist das gedacht?

Für Open-WebUI-Setups mit Ollama im Hintergrund.

Inhalt ansehen (dynamic_ollama_vision_filter_pipeline.py)
Lade …

Erfahrungen & Kommentare.

Funktioniert der Anleitung bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.