machichdigital

Lokale LLMs · Foto: derekGavey, CC BY 2.0

AnleitungOllamaLizenz: MITfrei kopierbar

rate_limit_filter_pipeline.py

Zuletzt aktualisiert:

⬇ Als Datei laden

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Anleitung

Lizenz

MIT

Anwendungsfeld

Ollama

Voraussetzungen

Keine besonderen — direkt loslegen.

Begrenzung der Anfragen pro Nutzer/Zeitraum — wichtig, wenn Familie/Team auf denselben Heimserver zugreifen.

So nutzt du es

Anleitung lesen, Befehle ins Terminal kopieren. Ollama gibt es für macOS, Windows und Linux — Installation von ollama.com.

Im Detail

Dieses Filter-Skript begrenzt, wie viele Anfragen ein einzelner Nutzer in einem bestimmten Zeitraum an das LLM stellen darf. Es setzt am inlet/outlet-Mechanismus von Open-WebUI-Pipelines an und blockt oder verzögert Anfragen, sobald ein konfiguriertes Limit überschritten wird. Relevant wird das, sobald mehrere Personen, etwa Familie oder Team, denselben Heimserver oder dieselbe GPU teilen: Ohne Begrenzung kann ein einzelner Nutzer durch Dauerbetrieb die Antwortzeiten für alle anderen in die Höhe treiben oder Ressourcen blockieren. Für Einzelnutzer-Setups ohne geteilte Hardware ist dieser Filter meist verzichtbar.

Praxis-Tipp

Limit pro Nutzer und Zeitfenster konfigurieren, z. B. 20 Anfragen pro 10 Minuten, und danach mit mehreren gleichzeitigen Testnutzern prüfen, ob die Begrenzung tatsächlich greift.

Siehe auch

Lizenz & Quelle

Inhalt ansehen (rate_limit_filter_pipeline.py)
Lade …

Erfahrungen & Kommentare.

Funktioniert der Anleitung bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.