Agent-Frameworks · Foto: m4rlonj, CC BY 2.0
langgraph_self_rag_local.ipynb
Zuletzt aktualisiert:
Typ
Code-Beispiel
Lizenz
MIT
Quelle
Anwendungsfeld
LangChain / LangGraph
Wie oben, lokal/offline.
Voraussetzungen
- Ollama lokal installiert inkl. eines passenden LLM-Modells
- Python-/Jupyter-Umgebung zum Ausführen des Notebooks
- Grundverständnis von RAG- und Self-RAG-Konzepten
Self-RAG mit lokalen LLMs (Ollama).
Für wen: Wie oben, lokal/offline.
Im Detail
Gleiche Self-RAG-Logik wie im Cloud-Beispiel — Prüfung der eigenen Antwort auf Quellenbeleg nach der Generierung, Wiederholung bei Bedarf —, aber komplett mit lokalen Modellen über Ollama. Damit bleibt der gesamte Ablauf inklusive Dokumente und Antworten auf der eigenen Infrastruktur, relevant bei Datenschutzauflagen oder Offline-Umgebungen. Da Self-RAG mehrere Bewertungs- und gegebenenfalls Regenerierungsschritte pro Anfrage braucht, steigt mit einem lokalen Modell die Antwortzeit spürbar gegenüber einem schnellen Cloud-API-Call. Gut geeignet, um das Prinzip der Selbstprüfung ohne API-Kosten zu testen, bevor man es produktiv mit einem stärkeren Cloud-Modell einsetzt.
Schritt für Schritt
- Ollama-Modell lokal starten und im Notebook als Backend eintragen
- Notebook Zelle für Zelle mit einer eigenen Testfrage durchlaufen lassen
- Die Selbstprüf-Schritte (Grounding-Check, Relevanzbewertung) genau beobachten, da sie bei kleinen Modellen öfter fehlschlagen
- Ergebnisse mit unterschiedlichen lokalen Modellen vergleichen, um ein für die eigene Hardware brauchbares zu finden
- Bei Auffälligkeiten in der Selbstprüfung die Zwischenausgaben einzeln prüfen statt nur dem Endergebnis zu vertrauen
- Entscheiden, ob das Setup nur als Lernvorlage dient oder mit stärkeren Modellen weiterverfolgt wird
Beispiel aus der Praxis
Sie stellen im Notebook eine Frage zu einem lokal per Ollama verarbeiteten Dokument; das System bewertet selbst, ob die Antwort durch den Kontext gedeckt ist, und generiert bei Bedarf neu. Mit einem kleineren lokalen Modell kann die Selbstbewertung dabei auch eine eigentlich korrekte Antwort fälschlich verwerfen.
Praxis-Tipp
Messen Sie die Latenz pro Anfrage früh — bei mehreren Regenerierungsrunden mit einem lokalen Modell kann eine Antwort mehrere Sekunden bis Minuten dauern.
Stolperfallen
Kleine lokale Modelle liefern bei der mehrstufigen Selbstprüfung unzuverlässigere Bewertungen als Cloud-Modelle, wodurch Fehler in der Pipeline wahrscheinlicher werden. Das Notebook deshalb als Lern- und Experimentiervorlage behandeln, nicht als Basis für produktionsreife Systeme mit hohen Genauigkeitsanforderungen.
Siehe auch
Lizenz & Quelle
- Lizenz: MIT
- Quelle: langchain-ai/langgraph
Inhalt ansehen (langgraph_self_rag_local.ipynb)
Lade …
Erfahrungen & Kommentare.
Funktioniert der Code-Beispiel bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
langgraph_agentic_rag.ipynb
Agentic RAG: Ein Agent entscheidet selbst, ob/was er aus dem Vektorindex abruft, statt stur immer zu suchen.
langgraph_adaptive_rag.ipynb
Adaptive RAG: Router wählt je Frage die Strategie (Index-Abruf vs. Websuche) + Selbstkorrektur bei schlechten Treffern.
langgraph_adaptive_rag_local.ipynb
Adaptive RAG komplett mit lokalen LLMs (Ollama) — ohne Cloud-API.
