machichdigital

Lokale LLMs · Foto: derekGavey, CC BY 2.0

AnleitungOllamaLizenz: MITfrei kopierbar

detoxify_filter_pipeline.py

Zuletzt aktualisiert:

⬇ Als Datei laden

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Anleitung

Lizenz

MIT

Anwendungsfeld

Ollama

Voraussetzungen

  • Open WebUI mit Pipelines-Framework installiert
  • Ausreichend lokale Rechenleistung, da das Detoxify-Modell lokal läuft
  • Grundkenntnisse Python zum Einbinden und Anpassen des Filters

Einordnung

AufwandEinrichtung & Einarbeitung2/5 · eher geringNutzenErtrag im Alltag4/5 · eher hochVoraussetzungenWas vorher da sein muss2/5 · eher gering1 = gering5 = hoch

Das Einbinden ist unkompliziert, der Nutzen für öffentlich zugängliche Installationen aber hoch.

Erkennt toxische Nachrichten (lokales Detoxify-Modell) und blockt sie vor dem LLM.

Im Detail

Dieses Filter-Skript schaltet ein schlankes, lokal laufendes Detoxify-Modell vor Ihr eigentliches Sprachmodell. Es bewertet eingehende Nachrichten auf toxische Inhalte wie Beleidigungen, Drohungen oder Hassrede und blockt sie, bevor sie das Hauptmodell erreichen. Das spart Rechenzeit gegenüber der Idee, das große LLM selbst moderieren zu lassen, und funktioniert komplett offline, ohne Daten an einen Cloud-Moderationsdienst zu senden. Sinnvoll für öffentlich zugängliche Chatbots, Community-Tools oder Kundensupport-Installationen, bei denen eine Grundabsicherung gegen Missbrauch nötig ist, ohne dafür extra API-Kosten oder Datenschutzrisiken einzugehen.

Schritt für Schritt

  1. Filter in der Pipelines-Instanz aktivieren, sodass er vor dem gewünschten Hauptmodell sitzt.
  2. Mit harmlosen und bewusst grenzwertigen Testnachrichten prüfen, ob die Blockierung wie erwartet greift.
  3. Blockierte Fälle sichten und kontrollieren, ob dabei auch harmlose Nachrichten fälschlich abgefangen werden.
  4. Bei öffentlichen Installationen wie Chatbots, Community-Tools oder Support den Filter dauerhaft vorschalten, um Missbrauch vor dem Hauptmodell abzufangen.
  5. Bei Bedarf mit weiteren Filtern kombinieren, etwa einer Begrenzung der Gesprächsrunden.

Beispiel aus der Praxis

In einem öffentlichen Community-Chatbot schreibt jemand eine beleidigende Nachricht; der Filter erkennt die Toxizität lokal und blockt sie, bevor sie das Hauptmodell überhaupt erreicht.

Praxis-Tipp

Setzen Sie den Toxizitäts-Schwellenwert konservativ an und testen Sie ihn zunächst im Log-Modus, bevor Sie live blocken – sonst riskieren Sie False Positives bei hart formulierter, aber legitimer Kritik.

Stolperfallen

Lokale Toxizitätsmodelle sind nicht perfekt — Kontext oder Sarkasmus können zu falschen Einstufungen führen, deshalb sollten blockierte Nachrichten anfangs stichprobenartig kontrolliert werden. Der Filter ersetzt zudem keine vollständige Moderation, sondern nur eine Vorstufe davor.

Siehe auch

Lizenz & Quelle

Häufige Fragen.

Kostet der Einsatz zusätzliche API-Gebühren?

Nein, das Detoxify-Modell läuft lokal, es fallen keine Kosten für einen Cloud-Moderationsdienst an.

Werden Daten an Dritte gesendet?

Nein, die Prüfung erfolgt komplett offline, ohne dass Daten einen externen Dienst erreichen.

Ersetzt der Filter eine vollständige Moderation?

Nein, er blockt offensichtlich toxische Nachrichten vorab und entlastet so das Hauptmodell, ist aber keine umfassende Moderationslösung.

Inhalt ansehen (detoxify_filter_pipeline.py)
Lade …

Erfahrungen & Kommentare.

Funktioniert der Anleitung bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.