mlx_manifold_pipeline.py
Apple-Silicon-Spezialist: Modelle über Apples MLX-Framework serven (schnell auf M-Chips).
Apple-Silicon-Spezialist: Modelle über Apples MLX-Framework serven (schnell auf M-Chips).
So nutzt du es
Anleitung lesen, Befehle ins Terminal kopieren. Ollama gibt es für macOS, Windows und Linux — Installation von ollama.com.
Im Detail
MLX ist Apples eigenes ML-Framework, optimiert für die Unified-Memory-Architektur der M-Chips. Diese Pipeline bindet einen MLX-Server als Backend in Open WebUI ein und macht – wie bei Manifold-Pipelines üblich – mehrere lokal geladene Modelle gleichzeitig verfügbar. Der Vorteil gegenüber Ollama oder llama.cpp: MLX nutzt GPU und Neural Engine von Apple Silicon oft effizienter aus, besonders bei speziell konvertierten Quantisierungen. Lohnt sich für Mac-M1-bis-M4-Nutzer, die maximale Performance aus ihrer Hardware holen wollen und bereit sind, Modelle im MLX-Format zu beschaffen. Einsteiger fahren mit Ollama einfacher.
Praxis-Tipp
Erst mlx-lm lokal testen (z. B. mlx_lm.server --model mlx-community/Llama-3.1-8B-Instruct-4bit), dann die Pipeline in Open WebUI verdrahten.
Siehe auch
Lizenz & Quelle
- Lizenz: MIT
- Quelle: open-webui/pipelines
Inhalt ansehen (mlx_manifold_pipeline.py)
Lade …
Erfahrungen & Kommentare.
Funktioniert der Anleitung bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
ollama_pipeline.py
Minimalbeispiel: Anfragen an einen Ollama-Server durchreichen — der beste Startpunkt, um das Pipeline-Prinzip zu verstehen.
ollama_manifold_pipeline.py
„Manifold": macht alle auf dem Ollama-Server installierten Modelle auf einmal verfügbar statt nur eines.
llama_cpp_pipeline.py
GGUF-Modelle direkt über die llama-cpp-python-Bibliothek fahren — ohne Ollama dazwischen.
