Agent-Frameworks · Foto: m4rlonj, CC BY 2.0
langgraph_self_rag.ipynb
Zuletzt aktualisiert:
Typ
Code-Beispiel
Lizenz
MIT
Quelle
Anwendungsfeld
LangChain / LangGraph
Höchste Antwortqualität bei Doku-/Wissens-Bots.
Voraussetzungen
- Python-/Jupyter-Umgebung mit LangGraph und LangChain
- API-Zugang zu einem LLM für Generierung und Selbstprüfung
- Vorhandener Vektorindex mit den Dokumenten, gegen die geprüft werden soll
Self-RAG: Modell prüft die eigene Antwort auf Fundierung in den Quellen und iteriert bei Bedarf.
Für wen: Höchste Antwortqualität bei Doku-/Wissens-Bots.
Im Detail
Self-RAG lässt das Modell nach der Antwortgenerierung selbst prüfen, ob die Antwort tatsächlich durch die abgerufenen Quellen gedeckt ist (Groundedness-Check) und ob sie die Frage überhaupt beantwortet. Fällt die Prüfung negativ aus, wird neu generiert oder erneut abgerufen, statt eine unbelegte Antwort auszugeben. Im Vergleich zu CRAG, das die Quellen vor der Antwort bewertet, setzt Self-RAG die Kontrolle nach der Generierung an und fängt so auch Fälle ab, in denen gute Quellen vorhanden waren, das Modell sie aber nicht korrekt genutzt hat. Empfehlenswert für Doku-Bots, bei denen unbelegte Antworten teuer sind (Support, Compliance) — auf Kosten von mehr LLM-Aufrufen pro Frage.
Schritt für Schritt
- Retriever und Dokumentenbasis auf den eigenen Anwendungsfall ausrichten, etwa eine Doku- oder Support-Wissensbasis
- Die Prüf-Schritte im Graph so einstellen, ab wann eine Antwort als nicht ausreichend fundiert gilt
- Mit typischen Nutzerfragen testen und beobachten, wie oft der Graph in die Selbstkorrektur geht
- Kosten und Antwortzeit im Blick behalten, da jede Prüfrunde einen zusätzlichen Modellaufruf kostet
- Eine Obergrenze für Wiederholungen setzen, damit die Pipeline nicht endlos weiterprüft
Beispiel aus der Praxis
Ein Support-Bot beantwortet eine Frage zu einem Produktfeature, prüft die eigene Antwort gegen die abgerufenen Quellen, stellt eine Lücke fest, holt gezielt weitere Dokumente nach und liefert erst dann die korrigierte Antwort aus.
Praxis-Tipp
Beobachten Sie die Anzahl der Regenerierungs-Durchläufe pro Anfrage — steigt sie dauerhaft an, deutet das eher auf ein Indexproblem als auf ein Prompt-Problem hin.
Stolperfallen
Der zusätzliche Prüfschritt macht jede Antwort langsamer und teurer als bei einfachem RAG oder CRAG. Ohne eine gesetzte Obergrenze für Wiederholungen kann der Graph bei schwer zu belegenden Fragen mehrfach neu generieren, statt zügig eine Antwort zu liefern.
Siehe auch
Lizenz & Quelle
- Lizenz: MIT
- Quelle: langchain-ai/langgraph
Inhalt ansehen (langgraph_self_rag.ipynb)
Lade …
Erfahrungen & Kommentare.
Funktioniert der Code-Beispiel bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
langgraph_agentic_rag.ipynb
Agentic RAG: Ein Agent entscheidet selbst, ob/was er aus dem Vektorindex abruft, statt stur immer zu suchen.
langgraph_adaptive_rag.ipynb
Adaptive RAG: Router wählt je Frage die Strategie (Index-Abruf vs. Websuche) + Selbstkorrektur bei schlechten Treffern.
langgraph_adaptive_rag_local.ipynb
Adaptive RAG komplett mit lokalen LLMs (Ollama) — ohne Cloud-API.
