Agent-Frameworks · Foto: m4rlonj, CC BY 2.0
langgraph_adaptive_rag_local.ipynb
Zuletzt aktualisiert:
Typ
Code-Beispiel
Lizenz
MIT
Quelle
Anwendungsfeld
LangChain / LangGraph
Datenschutz-sensible Setups, Offline-Betrieb.
Voraussetzungen
- Ollama lokal installiert und lauffähig
- Ausreichende GPU-/RAM-Ausstattung für lokale LLMs
- Passende Ollama-Modelle heruntergeladen (für Routing, Bewertung, Generierung)
- Grundkenntnisse in Python/Jupyter und LangGraph
Adaptive RAG komplett mit lokalen LLMs (Ollama) — ohne Cloud-API.
Für wen: Datenschutz-sensible Setups, Offline-Betrieb.
Im Detail
Gleiche Adaptive-RAG-Logik wie im Cloud-Beispiel — Routing zwischen Indexabruf und Websuche, Selbstkorrektur bei schlechten Treffern —, aber komplett mit lokalen Modellen über Ollama statt Cloud-APIs. Dadurch bleiben Anfragen und Dokumente auf der eigenen Maschine, relevant bei Datenschutzauflagen oder Offline-Betrieb. Nachteil: Lokale Modelle sind bei Routing- und Grading-Entscheidungen oft weniger zuverlässig als GPT-4-Klasse-Modelle, wodurch Fehlentscheidungen bei der Selbstkorrektur wahrscheinlicher werden. Gut geeignet, um die Architektur ohne API-Kosten zu erproben, bevor man für den produktiven Einsatz auf ein stärkeres Cloud-Modell wechselt. Voraussetzung ist eine laufende Ollama-Instanz mit ausreichend Rechenleistung.
Schritt für Schritt
- Ollama-Modelle festlegen, die für Routing, Retrieval-Bewertung und Generierung eingesetzt werden
- Modelle lokal laden und die Routing-Qualität mit einfachen Testabfragen prüfen
- Ergebnisse der Selbstkorrektur stichprobenartig gegen bekannte Antworten kontrollieren, da lokale Modelle hier schwächer sind
- Bei unzureichender Genauigkeit größere oder spezialisierte Ollama-Modelle testen
- Für Produktivbetrieb die Antwortqualität gegen eine dedizierte Server-Lösung wie vLLM oder llama.cpp abwägen
Beispiel aus der Praxis
Ein Unternehmen möchte interne Handbücher durchsuchen lassen, darf die Dokumente aber nicht an eine Cloud-API senden. Es lässt Fragen über die lokale Ollama-Pipeline laufen: Bei einfachen Fragen liefert der Index direkt die Antwort, bei Wissenslücken schaltet das System lokal auf Websuche um und bewertet das Ergebnis selbst.
Praxis-Tipp
Starten Sie mit „ollama pull llama3“ und prüfen Sie erst mit einfachen Fragen, ob Routing und Grading zuverlässig funktionieren, bevor Sie produktiv gehen.
Stolperfallen
Lokale Modelle sind bei Routing und Selbstbewertung meist schwächer als GPT-4-Klasse-Modelle, wodurch die Selbstkorrektur weniger zuverlässig greift und Fehler unbemerkt bleiben können. Ergebnisse bei kritischen Anwendungen daher manuell gegenprüfen statt der Selbstkorrektur blind zu vertrauen.
Siehe auch
Lizenz & Quelle
- Lizenz: MIT
- Quelle: langchain-ai/langgraph
Inhalt ansehen (langgraph_adaptive_rag_local.ipynb)
Lade …
Erfahrungen & Kommentare.
Funktioniert der Code-Beispiel bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
langgraph_agentic_rag.ipynb
Agentic RAG: Ein Agent entscheidet selbst, ob/was er aus dem Vektorindex abruft, statt stur immer zu suchen.
langgraph_adaptive_rag.ipynb
Adaptive RAG: Router wählt je Frage die Strategie (Index-Abruf vs. Websuche) + Selbstkorrektur bei schlechten Treffern.
langgraph_crag.ipynb
Corrective RAG (CRAG): Abgerufene Dokumente werden bewertet; bei schlechter Qualität wird die Suche korrigiert/ergänzt (Websuche).
