Lokale LLMs · Foto: derekGavey, CC BY 2.0
detoxify_filter_pipeline.py
Zuletzt aktualisiert:
Typ
Anleitung
Lizenz
MIT
Quelle
Anwendungsfeld
Ollama
Voraussetzungen
- Open WebUI mit Pipelines-Framework installiert
- Ausreichend lokale Rechenleistung, da das Detoxify-Modell lokal läuft
- Grundkenntnisse Python zum Einbinden und Anpassen des Filters
Einordnung
Das Einbinden ist unkompliziert, der Nutzen für öffentlich zugängliche Installationen aber hoch.
Erkennt toxische Nachrichten (lokales Detoxify-Modell) und blockt sie vor dem LLM.
Im Detail
Dieses Filter-Skript schaltet ein schlankes, lokal laufendes Detoxify-Modell vor Ihr eigentliches Sprachmodell. Es bewertet eingehende Nachrichten auf toxische Inhalte wie Beleidigungen, Drohungen oder Hassrede und blockt sie, bevor sie das Hauptmodell erreichen. Das spart Rechenzeit gegenüber der Idee, das große LLM selbst moderieren zu lassen, und funktioniert komplett offline, ohne Daten an einen Cloud-Moderationsdienst zu senden. Sinnvoll für öffentlich zugängliche Chatbots, Community-Tools oder Kundensupport-Installationen, bei denen eine Grundabsicherung gegen Missbrauch nötig ist, ohne dafür extra API-Kosten oder Datenschutzrisiken einzugehen.
Schritt für Schritt
- Filter in der Pipelines-Instanz aktivieren, sodass er vor dem gewünschten Hauptmodell sitzt.
- Mit harmlosen und bewusst grenzwertigen Testnachrichten prüfen, ob die Blockierung wie erwartet greift.
- Blockierte Fälle sichten und kontrollieren, ob dabei auch harmlose Nachrichten fälschlich abgefangen werden.
- Bei öffentlichen Installationen wie Chatbots, Community-Tools oder Support den Filter dauerhaft vorschalten, um Missbrauch vor dem Hauptmodell abzufangen.
- Bei Bedarf mit weiteren Filtern kombinieren, etwa einer Begrenzung der Gesprächsrunden.
Beispiel aus der Praxis
In einem öffentlichen Community-Chatbot schreibt jemand eine beleidigende Nachricht; der Filter erkennt die Toxizität lokal und blockt sie, bevor sie das Hauptmodell überhaupt erreicht.
Praxis-Tipp
Setzen Sie den Toxizitäts-Schwellenwert konservativ an und testen Sie ihn zunächst im Log-Modus, bevor Sie live blocken – sonst riskieren Sie False Positives bei hart formulierter, aber legitimer Kritik.
Stolperfallen
Lokale Toxizitätsmodelle sind nicht perfekt — Kontext oder Sarkasmus können zu falschen Einstufungen führen, deshalb sollten blockierte Nachrichten anfangs stichprobenartig kontrolliert werden. Der Filter ersetzt zudem keine vollständige Moderation, sondern nur eine Vorstufe davor.
Siehe auch
Lizenz & Quelle
- Lizenz: MIT
- Quelle: open-webui/pipelines
Häufige Fragen.
Kostet der Einsatz zusätzliche API-Gebühren?
Nein, das Detoxify-Modell läuft lokal, es fallen keine Kosten für einen Cloud-Moderationsdienst an.
Werden Daten an Dritte gesendet?
Nein, die Prüfung erfolgt komplett offline, ohne dass Daten einen externen Dienst erreichen.
Ersetzt der Filter eine vollständige Moderation?
Nein, er blockt offensichtlich toxische Nachrichten vorab und entlastet so das Hauptmodell, ist aber keine umfassende Moderationslösung.
Inhalt ansehen (detoxify_filter_pipeline.py)
Lade …
Erfahrungen & Kommentare.
Funktioniert der Anleitung bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
ollama_pipeline.py
Minimalbeispiel: Anfragen an einen Ollama-Server durchreichen — der beste Startpunkt, um das Pipeline-Prinzip zu verstehen.
ollama_manifold_pipeline.py
„Manifold": macht alle auf dem Ollama-Server installierten Modelle auf einmal verfügbar statt nur eines.
llama_cpp_pipeline.py
GGUF-Modelle direkt über die llama-cpp-python-Bibliothek fahren — ohne Ollama dazwischen.
