machichdigital

Agent-Frameworks · Foto: m4rlonj, CC BY 2.0

Code-BeispielLangChain / LangGraphLizenz: MITfrei kopierbar

langgraph_self_rag_local.ipynb

Zuletzt aktualisiert:

⬇ Als Datei laden

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Code-Beispiel

Lizenz

MIT

Anwendungsfeld

LangChain / LangGraph

Wie oben, lokal/offline.

Voraussetzungen

  • Ollama lokal installiert inkl. eines passenden LLM-Modells
  • Python-/Jupyter-Umgebung zum Ausführen des Notebooks
  • Grundverständnis von RAG- und Self-RAG-Konzepten

Self-RAG mit lokalen LLMs (Ollama).

Für wen: Wie oben, lokal/offline.

Im Detail

Gleiche Self-RAG-Logik wie im Cloud-Beispiel — Prüfung der eigenen Antwort auf Quellenbeleg nach der Generierung, Wiederholung bei Bedarf —, aber komplett mit lokalen Modellen über Ollama. Damit bleibt der gesamte Ablauf inklusive Dokumente und Antworten auf der eigenen Infrastruktur, relevant bei Datenschutzauflagen oder Offline-Umgebungen. Da Self-RAG mehrere Bewertungs- und gegebenenfalls Regenerierungsschritte pro Anfrage braucht, steigt mit einem lokalen Modell die Antwortzeit spürbar gegenüber einem schnellen Cloud-API-Call. Gut geeignet, um das Prinzip der Selbstprüfung ohne API-Kosten zu testen, bevor man es produktiv mit einem stärkeren Cloud-Modell einsetzt.

Schritt für Schritt

  1. Ollama-Modell lokal starten und im Notebook als Backend eintragen
  2. Notebook Zelle für Zelle mit einer eigenen Testfrage durchlaufen lassen
  3. Die Selbstprüf-Schritte (Grounding-Check, Relevanzbewertung) genau beobachten, da sie bei kleinen Modellen öfter fehlschlagen
  4. Ergebnisse mit unterschiedlichen lokalen Modellen vergleichen, um ein für die eigene Hardware brauchbares zu finden
  5. Bei Auffälligkeiten in der Selbstprüfung die Zwischenausgaben einzeln prüfen statt nur dem Endergebnis zu vertrauen
  6. Entscheiden, ob das Setup nur als Lernvorlage dient oder mit stärkeren Modellen weiterverfolgt wird

Beispiel aus der Praxis

Sie stellen im Notebook eine Frage zu einem lokal per Ollama verarbeiteten Dokument; das System bewertet selbst, ob die Antwort durch den Kontext gedeckt ist, und generiert bei Bedarf neu. Mit einem kleineren lokalen Modell kann die Selbstbewertung dabei auch eine eigentlich korrekte Antwort fälschlich verwerfen.

Praxis-Tipp

Messen Sie die Latenz pro Anfrage früh — bei mehreren Regenerierungsrunden mit einem lokalen Modell kann eine Antwort mehrere Sekunden bis Minuten dauern.

Stolperfallen

Kleine lokale Modelle liefern bei der mehrstufigen Selbstprüfung unzuverlässigere Bewertungen als Cloud-Modelle, wodurch Fehler in der Pipeline wahrscheinlicher werden. Das Notebook deshalb als Lern- und Experimentiervorlage behandeln, nicht als Basis für produktionsreife Systeme mit hohen Genauigkeitsanforderungen.

Siehe auch

Lizenz & Quelle

Inhalt ansehen (langgraph_self_rag_local.ipynb)
Lade …

Erfahrungen & Kommentare.

Funktioniert der Code-Beispiel bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.