Apache Airflow: Skalierbare Data Pipelines
Plane, betreibe und überwache Airflow-Workflows mit Python, Task SDK und belastbarer Architektur
Die wichtigsten Themen
DAGs mit Python und Task SDK
Scheduling und Backfills steuern
Operatoren und Sensoren erweitern
Celery und Kubernetes Executor
Monitoring mit Deadline Alerts
DAG-Tests und CI/CD-Strategien
Überblick Verabschiede dich von unübersichtlichen Cron-Jobs, isolierten Skripten und schwer nachvollziehbaren Datenläufen. Apache Airflow ist ein etabliertes Werkzeug für die programmatische Orchestrierung komplexer...
Verabschiede dich von unübersichtlichen Cron-Jobs, isolierten Skripten und schwer nachvollziehbaren Datenläufen. Apache Airflow ist ein etabliertes Werkzeug für die programmatische Orchestrierung komplexer Datenflüsse: Workflows werden als Code beschrieben, versioniert, geplant, überwacht und im Fehlerfall gezielt nachverfolgt.
In dieser Apache-Airflow-Schulung arbeitest du mit Data Pipelines, die vollständig in Python definiert werden. Der Kurs behandelt nicht nur einzelne DAGs, Operatoren und Schedules, sondern auch die Architekturentscheidungen, die für wartbare Produktionsumgebungen wichtig sind: Executor-Auswahl, Verteilung von Tasks, Wiederanläufe, Logging, Alerting und saubere Code-Strukturen. Dabei werden aktuelle Airflow-3.x-Konzepte berücksichtigt, darunter API Server, Public Interface, Task SDK und Deadline Alerts.
Besonders relevant ist das Training für Teams, die ETL- und ELT-Prozesse professionalisieren, Abhängigkeiten transparent machen und manuelle Betriebsaufwände reduzieren wollen. Wenn Analytics-Engineering im Anschluss vertieft werden soll, passt das dbt-Training für Analytics Engineering als fachliche Ergänzung zu modellgetriebenen Daten-Workflows.
Die Themen Scheduler, API Server und UI · Metadata Database und DAG Processor · Worker, Triggerer und Executors · DAG-Lebenszyklus und Task-Status · CLI, Web UI und REST API · Workflows als Python-Code...
Architektur und Core-Konzepte
- Scheduler, API Server und UI
- Metadata Database und DAG Processor
- Worker, Triggerer und Executors
- DAG-Lebenszyklus und Task-Status
- CLI, Web UI und REST API
DAG-Design mit Python
- Workflows als Python-Code
- Public Interface und Task SDK
- Standard-Operatoren für Bash und Python
- SQL-Tasks und Provider-Pakete
- Abhängigkeiten und Task-Reihenfolgen
Scheduling und Datenfluss
- Schedules, Catchup und Backfills
- Dataset- und Asset-orientierte Ausführung
- XComs für Task-Kommunikation
- Branching und bedingte Ausführung
- Dynamische DAGs und Task Mapping
Erweiterbarkeit und Integration
- Eigene Operatoren und Sensoren
- Hooks für externe Systeme
- Connections, Variables und Secrets
- Provider für Cloud- und Datenbankdienste
- Wiederverwendbarer Pipeline-Code
Production Engineering
- Local, Celery und Kubernetes Executor
- Retries, Timeouts und Fehlerbehandlung
- Deadline Alerts statt klassischer SLAs
- Logging, Monitoring und Benachrichtigungen
- DAG-Tests und CI/CD-Integration
Betrieb und Skalierung
- Deployment-Strategien für Airflow
- Konfiguration produktiver Umgebungen
- Ressourcenplanung für Worker
- Sicherer Umgang mit Secrets
- Wartbarkeit von Pipeline-Repositories
Zielgruppe
- Data Engineers und Data Scientists mit Verantwortung für automatisierte Datenprozesse
- DevOps-Spezialistinnen und Backend-Entwickler mit Pipeline- und Deployment-Aufgaben
- Software-Architektinnen im Big-Data- und Analytics-Umfeld
- Teams, die ETL-, ELT- oder Reporting-Prozesse skalierbar orchestrieren
Das lernst du
- Sicheres Modellieren von DAGs und Tasks mit Python
- Fundierte Einordnung der Airflow-Architektur und ihrer Betriebsrollen
- Auswahl geeigneter Executor- und Deployment-Strategien für unterschiedliche Lastprofile
- Robuste Fehlerbehandlung mit Retries, Timeouts, Logging und Deadline Alerts
- Eigenständige Erweiterung von Airflow durch Operatoren, Sensoren, Hooks und Provider
So arbeiten wir
- Technische Deep-Dives zu Architektur, Scheduling, Executors und Betriebsmodellen
- Hands-on Labs in einer vorbereiteten Airflow-Umgebung
- Schrittweiser Aufbau von DAGs mit steigender Komplexität
- Code-Übungen zu Operatoren, Hooks, XComs, Branching und Tests
- Simulation typischer Fehlerfälle für Debugging, Monitoring und Alerting
- Diskussion von Architekturentscheidungen aus produktiven Datenplattformen
Empfohlene Vorkenntnisse
- Solide Kenntnisse in Python
- Grundverständnis von SQL und Datenbankkonzepten
- Erfahrung mit Linux-Shell oder Kommandozeile
- Hilfreich: Grundlagen zu Containern, APIs und Git
- Für vorbereitende Datenarbeit mit Python eignet sich der Python Data Science Einstieg mit Pandas, Numpy & Co.
Dein Fahrplan
Der erste Tag legt die Basis für das Arbeiten mit Apache Airflow. Behandelt werden Architektur, zentrale Komponenten, Installation, Konfiguration und Navigation über CLI und Web UI. Anschließend werden erste DAGs mit Python erstellt, Tasks definiert, Abhängigkeiten modelliert und Schedules nachvollziehbar eingerichtet.
Organisatorisches
Lernformate
Unsere Seminare bieten dir maximale Flexibilität: Du kannst zwischen Live-Online und Vor Ort in unseren modernen Schulungszentren im D-A-CH Raum wählen. Beide Formate garantieren dir die gleiche hohe Qualität und interaktive Lernerfahrung.
Schulungsarten
Wir bieten dir verschiedene Schulungsarten: Offene Seminare, Firmenseminare für Teams und Inhouse-Schulungen direkt bei dir vor Ort. So findest du genau das Format, das zu deinen Bedürfnissen passt.
Uhrzeiten
9:00-16:00 Uhr
Aktuelle Software
In unseren offenen Kursen arbeiten wir mit der aktuellsten Software-Version. So lernst du direkt mit den Tools und Features, die du auch in deinem Arbeitsalltag verwendest - praxisnah und zukunftsorientiert. Bei Inhouse- und Firmenschulungen bestimmt ihr die Version.
Deine Vorteile
Zufriedenheitsgarantie
Wir sind von unserer Qualität überzeugt. Sollte ein Training einmal nicht deinen Erwartungen entsprechen, bieten wir dir an, den Kurs kostenlos zu wiederholen oder ein anderes Training zu besuchen. Ohne Risiko, ohne Diskussion.
Inklusivleistungen
Deine Teilnahme beinhaltet: Schulungsmaterial, Zertifikat, Verpflegung (bei Präsenzveranstaltungen) und persönliche Betreuung durch unsere Trainer und unser Orga-Team. Alles aus einer Hand - keine versteckten Kosten.
Lernen von Experten
Unsere Trainer sind zertifizierte und erfahrene Profis mit jahrelanger Berufserfahrung. Sie vermitteln dir in den Kursen nicht nur theoretisches Wissen, sondern teilen ihre Erfahrungen aus realen Projekten und helfen dir, das Gelernte direkt in deiner täglichen Arbeit anzuwenden. Das ist kein Werbeversprechen, sondern unser Anspruch. Am besten siehst du das in unseren Bewertungen, z.B. auch bei Google.
Keine Vorkasse
Du zahlst erst nach dem Seminar. Keine Vorkasse, keine Vorauszahlung - so kannst du sicher sein, dass du nur für das bezahlst, was du auch wirklich erhalten hast. Die Rechnung erhältst du erst nach Kursbeginn.
Max. 8 Teilnehmende
Wir setzen auf kleine Gruppen, damit du die Aufmerksamkeit bekommst, die du verdienst. So haben wir mehr Zeit für deine individuellen Fragen und können gezielt auf deine Bedürfnisse eingehen.
Termine & Buchung
Vor Ort
Online
Nicht der passende Termin dabei?
Wir finden eine Lösung: anderer Termin, mehrere Teilnehmer, Inhouse-Schulung oder individuelle Beratung.
Lieber gleich das ganze Team schulen?
Diese Schulung gibt es auch exklusiv für dein Unternehmen, bei euch vor Ort, an unseren Standorten oder Live-Online. Inhalte und Termine nach Maß.
Inhouse-Schulung
Wir kommen zu euch: diese Schulung maßgeschneidert in euren Räumen, für Unternehmen und Behörden.
- Inhalte exakt auf euch zugeschnitten
- Termine nach euren Bedürfnissen
- Günstiger ab mehreren Teilnehmern
- Vertraute Umgebung, kein Reiseaufwand
Firmen-Seminar
Exklusiv für dein Team an einem unserer Standorte oder Live-Online, individuell angepasst.
- Geschlossene Gruppe aus eurem Haus
- Individuelle Terminplanung
- An unseren Standorten oder Live-Online
- Angepasste Inhalte
Fragen und Antworten zu Apache Airflow: Skalierbare Data Pipelines
Welche Airflow-Version wird in der Schulung verwendet?
Die Schulung orientiert sich an aktuellen stabilen Airflow-3.x-Versionen. Behandelt werden unter anderem API Server, Public Interface, Task SDK, Provider-Pakete und Deadline Alerts. Unterschiede zu Airflow 2.x werden dort eingeordnet, wo sie für Migration, Code-Struktur oder Betrieb relevant sind.
Benötige ich Vorkenntnisse in Docker oder Kubernetes?
Grundkenntnisse in Container-Technologien sind hilfreich, besonders für Deployment-Fragen und den Kubernetes Executor. Zwingend erforderlich sind sie nicht. Für das Verständnis der Airflow-Konzepte reichen solide Python-Kenntnisse, SQL-Grundlagen und Erfahrung mit der Kommandozeile.
Ist das Apache-Airflow-Seminar für Einsteiger geeignet?
Das Training setzt Programmiererfahrung voraus und richtet sich nicht an komplette IT-Einsteigerinnen und IT-Einsteiger. Wer zunächst Datenanalyse, Datenpipelines und typische Data-Science-Begriffe einordnen möchte, kann vorher die Data Science und Machine Learning Einführung besuchen.
Geht es im Training eher um ETL oder ELT?
Beides wird berücksichtigt. Airflow orchestriert Abläufe und ist nicht auf ein einzelnes Integrationsmuster beschränkt. Im Seminar werden klassische ETL-Strecken, ELT-Prozesse, SQL-Tasks, externe Systeme und Abhängigkeiten zwischen Verarbeitungsschritten betrachtet.
Werden eigene Operatoren und Sensoren entwickelt?
Ja. Neben Standard-Operatoren werden eigene Operatoren, Sensoren und Hooks behandelt. Dadurch wird nachvollziehbar, wie Airflow an spezifische Systeme, interne Schnittstellen oder wiederkehrende Pipeline-Muster angebunden wird.
Hilft die Schulung bei der Migration von Airflow 2.x auf Airflow 3.x?
Die Schulung ist keine reine Migrationsberatung, behandelt aber die relevanten Änderungen für DAG-Autorinnen, Betreiber und Plattform-Teams. Dazu gehören aktualisierte Imports, Provider-Pakete, API-Änderungen, Deadline Alerts sowie Auswirkungen auf Plugins und Deployment.
Weitere häufig gestellte Fragen und Antworten findest du in den FAQs.
Passende Schulungen nach dem Kurs
Ähnliche Kurse
Google Cloud Associate Training: Data Practitioner mit BigQuery
Apache Iceberg Schulung: Spark und Flink verbinden
Apache Flink 2 Schulung: SQL und DataStream API
ClickHouse Schulung: OLAP-Pipelines
Dagster-Schulung für KI-Pipelines
Unser Qualitätsversprechen: Wissen, das in der Praxis funktioniert
Aus der Praxis für die Praxis
Schluss mit theoretischem Ballast. Wir trainieren dich für reale IT-Herausforderungen, nicht für Multiple-Choice-Tests. Unsere Trainer vermitteln dir genau das Wissen, das am nächsten Montagmorgen im Job wirklich funktioniert.
Individuell statt "Schema F"
Deine Fragen passen nicht ins Standard-Skript? Bei uns schon. Wir verzichten auf starre Lehrpläne und geben deinen konkreten Projekt-Fragen Raum. Unsere Trainer passen die Inhalte flexibel an das an, was dich und dein Team aktuell weiterbringt.
Maximale Freiheit: Remote oder vor Ort
Lerne so, wie es in deinen Alltag passt - ohne Reise-Stress und Zeitverlust. Egal ob remote, hybrid oder präsent vor Ort: Wir garantieren dir ein nahtloses und effektives Lernerlebnis, egal von wo du dich zuschaltest.
Mit Zufriedenheitsgarantie
Wir sind von unserer Qualität überzeugt - und wollen, dass du es auch bist. Sollte ein Training einmal nicht deinen Erwartungen entsprechen, bieten wir dir an, den Kurs kostenlos zu wiederholen oder ein anderes Training zu besuchen. Ohne Risiko, ohne Diskussion.
Über 20.000 Unternehmen und Behörden vertrauen auf uns