Lokale LLMs · Foto: derekGavey, CC BY 2.0
rate_limit_filter_pipeline.py
Zuletzt aktualisiert:
Typ
Anleitung
Lizenz
MIT
Quelle
Anwendungsfeld
Ollama
Voraussetzungen
Keine besonderen — direkt loslegen.
Begrenzung der Anfragen pro Nutzer/Zeitraum — wichtig, wenn Familie/Team auf denselben Heimserver zugreifen.
So nutzt du es
Anleitung lesen, Befehle ins Terminal kopieren. Ollama gibt es für macOS, Windows und Linux — Installation von ollama.com.
Im Detail
Dieses Filter-Skript begrenzt, wie viele Anfragen ein einzelner Nutzer in einem bestimmten Zeitraum an das LLM stellen darf. Es setzt am inlet/outlet-Mechanismus von Open-WebUI-Pipelines an und blockt oder verzögert Anfragen, sobald ein konfiguriertes Limit überschritten wird. Relevant wird das, sobald mehrere Personen, etwa Familie oder Team, denselben Heimserver oder dieselbe GPU teilen: Ohne Begrenzung kann ein einzelner Nutzer durch Dauerbetrieb die Antwortzeiten für alle anderen in die Höhe treiben oder Ressourcen blockieren. Für Einzelnutzer-Setups ohne geteilte Hardware ist dieser Filter meist verzichtbar.
Praxis-Tipp
Limit pro Nutzer und Zeitfenster konfigurieren, z. B. 20 Anfragen pro 10 Minuten, und danach mit mehreren gleichzeitigen Testnutzern prüfen, ob die Begrenzung tatsächlich greift.
Siehe auch
Lizenz & Quelle
- Lizenz: MIT
- Quelle: open-webui/pipelines
Inhalt ansehen (rate_limit_filter_pipeline.py)
Lade …
Erfahrungen & Kommentare.
Funktioniert der Anleitung bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
ollama_pipeline.py
Minimalbeispiel: Anfragen an einen Ollama-Server durchreichen — der beste Startpunkt, um das Pipeline-Prinzip zu verstehen.
ollama_manifold_pipeline.py
„Manifold": macht alle auf dem Ollama-Server installierten Modelle auf einmal verfügbar statt nur eines.
llama_cpp_pipeline.py
GGUF-Modelle direkt über die llama-cpp-python-Bibliothek fahren — ohne Ollama dazwischen.
