Lokale LLMs · Foto: derekGavey, CC BY 2.0
llamaindex_ollama_pipeline.py
Zuletzt aktualisiert:
Typ
Anleitung
Lizenz
MIT
Quelle
Anwendungsfeld
Ollama
Voraussetzungen
Keine besonderen — direkt loslegen.
Das Basis-Rezept für lokales RAG: Dokumente aus einem Ordner indexieren (LlamaIndex) und mit lokalem Ollama-Modell + lokalen Embeddings befragen.
So nutzt du es
Anleitung lesen, Befehle ins Terminal kopieren. Ollama gibt es für macOS, Windows und Linux — Installation von ollama.com.
Im Detail
Diese Anleitung ist das Grundrezept für lokales RAG (Retrieval-Augmented Generation): Dokumente aus einem Ordner werden mit LlamaIndex indexiert, per lokalem Embedding-Modell in Vektoren umgewandelt und anschließend über ein lokal laufendes Ollama-Modell befragt. Der große Vorteil gegenüber Cloud-RAG-Lösungen ist, dass keine Daten das eigene System verlassen – wichtig bei vertraulichen Unterlagen, internen Wikis oder Kundendaten. Als Einstiegspunkt eignet sie sich für alle, die verstehen wollen, wie RAG grundsätzlich funktioniert, bevor sie zu spezialisierteren Varianten wie der GitHub-Integration oder Text-to-SQL wechseln. Für fortgeschrittene Suche (Hybrid, Reranking) muss die Pipeline manuell erweitert werden.
Praxis-Tipp
Zum Einstieg einen kleinen Testordner mit 5-10 PDFs verwenden, um Indexierungszeit und Antwortqualität schnell einschätzen zu können.
Siehe auch
Lizenz & Quelle
- Lizenz: MIT
- Quelle: open-webui/pipelines
Inhalt ansehen (llamaindex_ollama_pipeline.py)
Lade …
Erfahrungen & Kommentare.
Funktioniert der Anleitung bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
ollama_pipeline.py
Minimalbeispiel: Anfragen an einen Ollama-Server durchreichen — der beste Startpunkt, um das Pipeline-Prinzip zu verstehen.
ollama_manifold_pipeline.py
„Manifold": macht alle auf dem Ollama-Server installierten Modelle auf einmal verfügbar statt nur eines.
llama_cpp_pipeline.py
GGUF-Modelle direkt über die llama-cpp-python-Bibliothek fahren — ohne Ollama dazwischen.
