machichdigital

Agent-Frameworks · Foto: m4rlonj, CC BY 2.0

Code-BeispielLangChain / LangGraphLizenz: MITfrei kopierbar

langgraph_adaptive_rag_local.ipynb

Zuletzt aktualisiert:

⬇ Als Datei laden

⧉ –× kopiert⬇ –× heruntergeladenBewertung:

Typ

Code-Beispiel

Lizenz

MIT

Anwendungsfeld

LangChain / LangGraph

Datenschutz-sensible Setups, Offline-Betrieb.

Voraussetzungen

  • Ollama lokal installiert und lauffähig
  • Ausreichende GPU-/RAM-Ausstattung für lokale LLMs
  • Passende Ollama-Modelle heruntergeladen (für Routing, Bewertung, Generierung)
  • Grundkenntnisse in Python/Jupyter und LangGraph

Adaptive RAG komplett mit lokalen LLMs (Ollama) — ohne Cloud-API.

Für wen: Datenschutz-sensible Setups, Offline-Betrieb.

Im Detail

Gleiche Adaptive-RAG-Logik wie im Cloud-Beispiel — Routing zwischen Indexabruf und Websuche, Selbstkorrektur bei schlechten Treffern —, aber komplett mit lokalen Modellen über Ollama statt Cloud-APIs. Dadurch bleiben Anfragen und Dokumente auf der eigenen Maschine, relevant bei Datenschutzauflagen oder Offline-Betrieb. Nachteil: Lokale Modelle sind bei Routing- und Grading-Entscheidungen oft weniger zuverlässig als GPT-4-Klasse-Modelle, wodurch Fehlentscheidungen bei der Selbstkorrektur wahrscheinlicher werden. Gut geeignet, um die Architektur ohne API-Kosten zu erproben, bevor man für den produktiven Einsatz auf ein stärkeres Cloud-Modell wechselt. Voraussetzung ist eine laufende Ollama-Instanz mit ausreichend Rechenleistung.

Schritt für Schritt

  1. Ollama-Modelle festlegen, die für Routing, Retrieval-Bewertung und Generierung eingesetzt werden
  2. Modelle lokal laden und die Routing-Qualität mit einfachen Testabfragen prüfen
  3. Ergebnisse der Selbstkorrektur stichprobenartig gegen bekannte Antworten kontrollieren, da lokale Modelle hier schwächer sind
  4. Bei unzureichender Genauigkeit größere oder spezialisierte Ollama-Modelle testen
  5. Für Produktivbetrieb die Antwortqualität gegen eine dedizierte Server-Lösung wie vLLM oder llama.cpp abwägen

Beispiel aus der Praxis

Ein Unternehmen möchte interne Handbücher durchsuchen lassen, darf die Dokumente aber nicht an eine Cloud-API senden. Es lässt Fragen über die lokale Ollama-Pipeline laufen: Bei einfachen Fragen liefert der Index direkt die Antwort, bei Wissenslücken schaltet das System lokal auf Websuche um und bewertet das Ergebnis selbst.

Praxis-Tipp

Starten Sie mit „ollama pull llama3“ und prüfen Sie erst mit einfachen Fragen, ob Routing und Grading zuverlässig funktionieren, bevor Sie produktiv gehen.

Stolperfallen

Lokale Modelle sind bei Routing und Selbstbewertung meist schwächer als GPT-4-Klasse-Modelle, wodurch die Selbstkorrektur weniger zuverlässig greift und Fehler unbemerkt bleiben können. Ergebnisse bei kritischen Anwendungen daher manuell gegenprüfen statt der Selbstkorrektur blind zu vertrauen.

Siehe auch

Lizenz & Quelle

Inhalt ansehen (langgraph_adaptive_rag_local.ipynb)
Lade …

Erfahrungen & Kommentare.

Funktioniert der Code-Beispiel bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.

Lade Kommentare …

Ihre IP-Adresse wird zum Schutz vor Missbrauch gespeichert und nach 14 Tagen automatisch entfernt (Datenschutz).

Passt dazu.