rate_limit_filter_pipeline.py
Begrenzung der Anfragen pro Nutzer/Zeitraum — wichtig, wenn Familie/Team auf denselben Heimserver zugreifen.
Begrenzung der Anfragen pro Nutzer/Zeitraum — wichtig, wenn Familie/Team auf denselben Heimserver zugreifen.
So nutzt du es
Anleitung lesen, Befehle ins Terminal kopieren. Ollama gibt es für macOS, Windows und Linux — Installation von ollama.com.
Im Detail
Diese Open-WebUI-Pipeline greift als Filter in Ein- und Ausgaben ein und begrenzt, wie viele Anfragen ein einzelner Nutzer in einem bestimmten Zeitraum stellen darf. Relevant wird das, sobald mehrere Personen – etwa Familie oder Team – denselben lokal gehosteten LLM-Server nutzen: Ohne Begrenzung kann eine Person durch viele parallele Anfragen den Server für alle anderen langsam machen, besonders bei ressourcenhungrigen Modellen. Die Pipeline ist ein einfacher, aber wirkungsvoller Baustein für Mehrbenutzer-Setups und folgt demselben Inlet/Outlet-Muster wie andere Filter-Pipelines, etwa für Übersetzung oder Vision-Vorverarbeitung.
Praxis-Tipp
Limit z. B. auf „10 Anfragen pro Nutzer und 5 Minuten“ setzen und pro Nutzerkonto konfigurieren, damit ein Vielnutzer nicht die Antwortzeiten für alle anderen verschlechtert.
Siehe auch
Lizenz & Quelle
- Lizenz: MIT
- Quelle: open-webui/pipelines
Inhalt ansehen (rate_limit_filter_pipeline.py)
Lade …
Erfahrungen & Kommentare.
Funktioniert der Anleitung bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
ollama_pipeline.py
Minimalbeispiel: Anfragen an einen Ollama-Server durchreichen — der beste Startpunkt, um das Pipeline-Prinzip zu verstehen.
ollama_manifold_pipeline.py
„Manifold": macht alle auf dem Ollama-Server installierten Modelle auf einmal verfügbar statt nur eines.
llama_cpp_pipeline.py
GGUF-Modelle direkt über die llama-cpp-python-Bibliothek fahren — ohne Ollama dazwischen.
