Claude · Foto: Lachlan Hardy, CC BY 2.0
data-engineer
Zuletzt aktualisiert:
Typ
Subagent
Lizenz
MIT
Quelle
Anwendungsfeld
Claude Subagenten
Data-Engineering-Teams.
Voraussetzungen
- Bestehende oder geplante Datenpipelines zwischen Quellsystemen und Data Warehouse/Lake
- Zugriff auf betroffene Systeme, Skripte bzw. Orchestrierungs-Konfiguration
- Sinnvoll erst bei mehrstufigen Pipelines mit Orchestrierungs- und Qualitätsanforderungen
Einordnung
Lohnt sich erst bei mehrstufigen Pipelines mit echter Orchestrierung, nicht für einzelne Abfragen.
Datenpipelines, ETL/ELT, Orchestrierung, Datenqualität und Optimierung der Datenverarbeitung.
Für wen: Data-Engineering-Teams.
Im Detail
Dieser Subagent entwirft und baut Datenpipelines, ETL/ELT-Prozesse und Dateninfrastruktur — von der Architektur über Orchestrierung bis zur Datenqualitätssicherung. Der Fokus liegt auf Skalierbarkeit, Zuverlässigkeit und Kostenoptimierung bei der Datenverarbeitung, etwa beim Aufbau eines Data Lake oder Data Warehouse oder bei Stream-Processing-Anwendungen. Sinnvoll ist der Einsatz für Teams, die wiederkehrende Datenprobleme wie inkonsistente Datenqualität, fehleranfällige manuelle ETL-Skripte oder unklare Pipeline-Architekturen strukturiert angehen wollen. Im Gegensatz zu backend-architect, der sich um Anwendungsarchitektur kümmert, liegt der Schwerpunkt hier klar auf Datenflüssen und deren Verarbeitung. Für die zugrundeliegende Cloud-Infrastruktur arbeitet er gut mit cloud-architect oder devops-engineer zusammen.
Schritt für Schritt
- Bestehende Pipeline, Transformationslogik oder ein konkretes Fehlerbild wie einen fehlerhaften Ladevorgang bereitstellen.
- Konkretes Ziel benennen: neue Pipeline entwerfen, Fehler debuggen oder langsamen Batch-Job optimieren.
- Vorgeschlagene Transformationslogik oder Optimierung im eigenen Orchestrierungs-Tool testen.
- Datenqualitätsprüfungen aus dem Vorschlag in den bestehenden Workflow integrieren.
- Ergebnis mit echten Daten testen, bevor es produktiv geschaltet wird.
Beispiel aus der Praxis
Ein nächtlicher Batch-Job lädt Daten zu langsam ins Warehouse; nach Übergabe von Pipeline-Struktur und Laufzeiten schlägt der Subagent eine inkrementelle Ladestrategie statt einer Vollladung vor.
Praxis-Tipp
Beschreiben Sie zum Beispiel ‘Entwirf eine ETL-Pipeline, die täglich Rohdaten aus S3 bereinigt und ins Warehouse lädt’ für ein konkretes Pipeline-Konzept.
Stolperfallen
Bei einfachen Einzelabfragen ist der Agent überdimensioniert – sein Mehrwert entsteht erst bei mehrstufigen, orchestrierten Pipelines. Vorschläge sollten vor dem produktiven Einsatz mit echten Daten getestet werden, da fehlerhafte Ladelogik teuer zu korrigieren ist.
Siehe auch
Lizenz & Quelle
- Lizenz: MIT
- Quelle: VoltAgent
Häufige Fragen.
Brauche ich dafür bereits eine Pipeline-Infrastruktur?
Sein Mehrwert zeigt sich vor allem bei bestehenden, mehrstufigen Datenflüssen zwischen Quellsystemen und Data Warehouse.
Reicht er für einzelne SQL-Abfragen?
Nein, dafür ist er nicht nötig – er lohnt sich erst bei komplexeren Pipelines mit Orchestrierung.
Kümmert er sich auch um Datenqualität?
Ja, die Sicherstellung von Datenqualität gehört laut Beschreibung neben ETL/ELT und Orchestrierung zu seinem Fokus.
Inhalt ansehen (data-engineer.md)
Lade …
Erfahrungen & Kommentare.
Funktioniert der Subagent bei Ihnen? Tipps, Stolperfallen, Varianten — teilen Sie es mit der Community.
Lade Kommentare …
Passt dazu.
code-reviewer
Tiefgehendes Code-Review: Sicherheitslücken, Performance, Zuverlässigkeit, Konfigurations-Review, moderne Analyse-Tools.
debugger
Spezialist für Fehler, fehlschlagende Tests und unerwartetes Verhalten; arbeitet systematisch zur Ursache.
security-auditor
DevSecOps-Audit: Schwachstellenanalyse, Threat Modeling, OAuth2/OIDC, OWASP, Cloud-Security, Compliance.
