Lokale LLMs · Foto: derekGavey, CC BY 2.0
dynamic_ollama_vision_filter_pipeline.py
Zuletzt aktualisiert:
Typ
Anleitung
Lizenz
MIT
Quelle
Anwendungsfeld
Ollama
Voraussetzungen
- Laufendes Open-WebUI-Setup
- Lokal bereitgestelltes Vision-Modell wie LLaVA zusätzlich zum Text-Modell
- Laufende Ollama-Instanz
Einordnung
Die Filterlogik selbst ist schnell eingerichtet, setzt aber ein zusätzlich laufendes Vision-Modell voraus.
Leitet Anfragen mit Bildern automatisch an ein Vision-Modell (z. B. llava) um — Text-Modell und Bild-Modell wirken wie eines.
Im Detail
Diese Filter-Pipeline erkennt automatisch, wenn eine Nachricht ein Bild enthält, und leitet die Anfrage transparent an ein Vision-Modell wie LLaVA weiter, statt sie an Ihr normales Text-Modell zu schicken. Für Nutzerinnen und Nutzer verschwimmt dadurch der Unterschied zwischen Text- und Bildmodell zu einer einzigen Chat-Oberfläche – ein manuelles Umschalten entfällt, wenn mal ein Foto beschrieben werden soll. Praktisch für Open-WebUI-Setups, in denen ein schnelles, spezialisiertes Textmodell als Standard läuft, aber gelegentlich Bildverständnis gebraucht wird, ohne dauerhaft ein größeres multimodales Modell vorzuhalten.
Schritt für Schritt
- Vision-Modell wie LLaVA zusätzlich zum bestehenden Text-Modell in Ollama bereitstellen.
- Filter-Pipeline in Open-WebUI aktivieren.
- Testnachricht mit Bild senden und prüfen, ob automatisch ans Vision-Modell weitergeleitet wird.
- Normale Textanfragen parallel testen, um sicherzustellen, dass sie weiterhin ans Standard-Textmodell gehen.
- Bei Bedarf festlegen, ob das Vision-Modell dauerhaft geladen bleibt oder nur bei Bedarf gestartet wird.
Beispiel aus der Praxis
Jemand schickt im gewohnten Chat ein Foto eines defekten Geräteteils mit der Frage, was das sei; die Pipeline erkennt das Bild automatisch und lässt LLaVA statt des Text-Modells antworten, ohne dass manuell umgeschaltet werden muss.
Praxis-Tipp
Prüfen Sie vorab mit ollama list, ob das gewünschte Vision-Modell (z. B. llava oder llama3.2-vision) bereits lokal vorliegt, sonst schlägt die automatische Umleitung beim ersten Bild-Upload fehl.
Stolperfallen
Wird kein Vision-Modell wie LLaVA lokal bereitgestellt, läuft die Weiterleitung ins Leere - die Pipeline erkennt Bilder nur, das Bildverständnis liefert sie nicht selbst.
Siehe auch
Lizenz & Quelle
- Lizenz: MIT
- Quelle: open-webui/pipelines
Häufige Fragen.
Muss ich manuell zwischen Text- und Bildmodell wechseln?
Nein, genau das übernimmt die Pipeline automatisch, sobald eine Nachricht ein Bild enthält.
Brauche ich dauerhaft ein großes multimodales Modell?
Nein, ein schnelles Textmodell kann als Standard laufen, das Vision-Modell wird nur bei Bildern hinzugezogen.
Für welche Umgebung ist das gedacht?
Für Open-WebUI-Setups mit Ollama im Hintergrund.
Inhalt ansehen (dynamic_ollama_vision_filter_pipeline.py)
Lade …
Erfahrungen & Kommentare.
Funktioniert der Anleitung bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
ollama_pipeline.py
Minimalbeispiel: Anfragen an einen Ollama-Server durchreichen — der beste Startpunkt, um das Pipeline-Prinzip zu verstehen.
ollama_manifold_pipeline.py
„Manifold": macht alle auf dem Ollama-Server installierten Modelle auf einmal verfügbar statt nur eines.
llama_cpp_pipeline.py
GGUF-Modelle direkt über die llama-cpp-python-Bibliothek fahren — ohne Ollama dazwischen.
