llama_cpp_pipeline.py
GGUF-Modelle direkt über die llama-cpp-python-Bibliothek fahren — ohne Ollama dazwischen.
GGUF-Modelle direkt über die llama-cpp-python-Bibliothek fahren — ohne Ollama dazwischen.
So nutzt du es
Anleitung lesen, Befehle ins Terminal kopieren. Ollama gibt es für macOS, Windows und Linux — Installation von ollama.com.
Im Detail
Diese Pipeline bindet GGUF-Modelle über die Python-Bibliothek llama-cpp-python direkt in Open WebUI ein, ohne den Umweg über den Ollama-Server. Das spart eine Zwischenschicht und gibt direkten Zugriff auf llama.cpp-Parameter wie Kontextgröße, GPU-Layer oder Sampling-Einstellungen im Python-Code selbst. Sinnvoll für alle, die bereits mit llama-cpp-python arbeiten, eigene Modell-Ladelogik brauchen oder Ollama bewusst vermeiden wollen, etwa um Ressourcen zu sparen oder mehr Kontrolle über das Laden mehrerer Modelle zu haben. Für den Einstieg ist der Ollama-Weg meist einfacher – diese Pipeline richtet sich an Nutzer mit konkretem Grund, tiefer einzusteigen.
Praxis-Tipp
Modellpfad und n_gpu_layers direkt im Pipeline-Code anpassen, z. B. n_gpu_layers=-1, um das komplette Modell auf die GPU zu laden.
Siehe auch
Lizenz & Quelle
- Lizenz: MIT
- Quelle: open-webui/pipelines
Inhalt ansehen (llama_cpp_pipeline.py)
Lade …
Erfahrungen & Kommentare.
Funktioniert der Anleitung bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
ollama_pipeline.py
Minimalbeispiel: Anfragen an einen Ollama-Server durchreichen — der beste Startpunkt, um das Pipeline-Prinzip zu verstehen.
ollama_manifold_pipeline.py
„Manifold": macht alle auf dem Ollama-Server installierten Modelle auf einmal verfügbar statt nur eines.
mlx_manifold_pipeline.py
Apple-Silicon-Spezialist: Modelle über Apples MLX-Framework serven (schnell auf M-Chips).
