Apache Iceberg Schulung: Spark und Flink verbinden
Baue Tabellen mit REST Catalog, beherrsche Commit-Konflikte und halte Batch- und Streaming-Jobs auf demselben Datenstand
Die wichtigsten Themen
Iceberg-Metadaten gezielt prüfen
Schema und Partitionen weiterentwickeln
Spark- und Flink-Writes koordinieren
Commit-Konflikte reproduzieren
Snapshots zurücksetzen und bereinigen
Dateien durch Compaction bündeln
Überblick Jeder erfolgreiche Daten-Commit erzeugt in Apache Iceberg einen neuen Snapshot. Spark und Flink greifen über denselben Katalog auf die Iceberg-Tabelle zu. Die Apache Iceberg Schulung zeigt den Zusammenhang zwischen...
Jeder erfolgreiche Daten-Commit erzeugt in Apache Iceberg einen neuen Snapshot. Spark und Flink greifen über denselben Katalog auf die Iceberg-Tabelle zu. Die Apache Iceberg Schulung zeigt den Zusammenhang zwischen Parquet-Dateien, Manifesten und Snapshot-Metadaten anhand einer bereitgestellten Laborumgebung. Du konfigurierst einen REST-Catalog, schreibst Batch-Daten mit Spark und Streaming-Daten mit Flink.
In der Laborumgebung löst du konkurrierende Schreibvorgänge aus und prüfst, wann Iceberg einen Commit zurückweist. Du analysierst den betroffenen Snapshot und wiederholst die Änderung auf dem aktuellen Tabellenstand. Mit Time-Travel prüfst du einen früheren Stand und setzt die Tabelle per Rollback auf einen ausgewählten Snapshot zurück. Danach verdichtest du kleine Dateien per Compaction. Für ältere Snapshots definierst du Aufbewahrungsgrenzen. Verwaiste Dateien bereinigst du nach einer Sicherheitsfrist. Lokale Installationen und eigene Lizenzen entfallen.
Maximal acht Personen bearbeiten die Abläufe gemeinsam mit einer Fachdozentin oder einem Fachdozenten. Für dein Data-Engineering-Team kann cmt die Schulung als Inhouse-Training auf eure Systemumgebung abstimmen.
Die Themen Iceberg als offene Tabellenschicht · Parquet-Dateien innerhalb einer Iceberg-Tabelle · Hierarchie der Iceberg-Metadatenebenen · Zuordnung von Dateien zu Snapshots · Schema-Evolution über stabile Feld-IDs...
Tabellenformat und Metadatenstruktur
- Iceberg als offene Tabellenschicht
- Parquet-Dateien innerhalb einer Iceberg-Tabelle
- Hierarchie der Iceberg-Metadatenebenen
- Zuordnung von Dateien zu Snapshots
Schema- und Partitionsevolution
- Schema-Evolution über stabile Feld-IDs
- Zulässige Änderungen an Datentypen
- Partition-Evolution ohne Datenumschreibung
- Partition-Pruning durch Hidden Partitioning
Snapshots und Tabellenhistorie
- Snapshot-Verlauf und Tabellenreferenzen
- Time-Travel über Snapshot-IDs
- Time-Travel über Zeitstempel
- Rollback auf frühere Snapshots
- Isolation paralleler Schreibvorgänge
Batch-Verarbeitung mit Spark
- Iceberg-Tabellen mit Spark SQL
- Spark-Konfiguration für den REST-Catalog
- Batch-Schreibvorgänge mit atomaren Commits
- Analyse konkurrierender Spark-Commits
Streaming-Verarbeitung mit Flink
- Iceberg-Tabellen mit Flink SQL
- Flink-Konfiguration für den REST-Catalog
- Streaming-Commits über Flink-Checkpoints
- Sichtbarkeit neuer Snapshots in Spark
- Konkurrierende Spark- und Flink-Commits
Tabellenwartung und Dateibereinigung
- Auswirkungen kleiner Dateien auf Lesepläne
- Compaction mit system.rewrite_data_files
- Ablaufregeln für ältere Snapshots
- Bereinigung verwaister Dateien nach Sicherheitsfrist
Zielgruppe
- Data Engineers mit Spark- oder Flink-Erfahrung
- Data Architects für offene Lakehouse-Plattformen
- Platform Engineers mit Verantwortung für Dateninfrastruktur
- Technical Leads für Batch- und Streaming-Architekturen
Das lernst du
- Iceberg-Tabellen mit Spark und Flink erstellen
- Metadaten, Manifeste und Snapshots zur Fehleranalyse nutzen
- Schemas und Partitionierungen ohne vollständige Datenumschreibung weiterentwickeln
- Concurrent Writes untersuchen und Commit-Konflikte behandeln
- Fehlerhafte Tabellenstände per Time-Travel prüfen und per Rollback zurücksetzen
- Compaction und Snapshot-Bereinigung für planbare Lesezeiten und kontrollierten Speicherverbrauch einsetzen
So arbeiten wir
Kurze Fachimpulse wechseln mit angeleiteten Laborübungen und gemeinsamer Fehleranalyse. Die bereitgestellte Umgebung umfasst Spark, Flink, einen REST Catalog und vorbereitete Datensätze. Eigene Geräte oder Softwarelizenzen sind nicht erforderlich.
Empfohlene Vorkenntnisse
- Grundkenntnisse in SQL und verteilten Datenplattformen
- Erste Erfahrung mit Spark oder Flink
Dein Fahrplan
- Architektur einer Iceberg-Tabelle untersuchen
- Parquet-Dateien und Metadatenpfade verfolgen
- Schema- und Partition-Evolution durchführen
- Snapshots per Time-Travel abfragen
- Tabellenstände per Rollback zurücksetzen
Organisatorisches
Lernformate
Unsere Seminare bieten dir maximale Flexibilität: Du kannst zwischen Live-Online und Vor Ort in unseren modernen Schulungszentren im D-A-CH Raum wählen. Beide Formate garantieren dir die gleiche hohe Qualität und interaktive Lernerfahrung.
Schulungsarten
Wir bieten dir verschiedene Schulungsarten: Offene Seminare, Firmenseminare für Teams und Inhouse-Schulungen direkt bei dir vor Ort. So findest du genau das Format, das zu deinen Bedürfnissen passt.
Uhrzeiten
09:00-16:00 Uhr
Aktuelle Software
In unseren offenen Kursen arbeiten wir mit der aktuellsten Software-Version. So lernst du direkt mit den Tools und Features, die du auch in deinem Arbeitsalltag verwendest - praxisnah und zukunftsorientiert. Bei Inhouse- und Firmenschulungen bestimmt ihr die Version.
Deine Vorteile
Zufriedenheitsgarantie
Wir sind von unserer Qualität überzeugt. Sollte ein Training einmal nicht deinen Erwartungen entsprechen, bieten wir dir an, den Kurs kostenlos zu wiederholen oder ein anderes Training zu besuchen. Ohne Risiko, ohne Diskussion.
Inklusivleistungen
Deine Teilnahme beinhaltet: Schulungsmaterial, Zertifikat, Verpflegung (bei Präsenzveranstaltungen) und persönliche Betreuung durch unsere Trainer und unser Orga-Team. Alles aus einer Hand - keine versteckten Kosten.
Lernen von Experten
Unsere Trainer sind zertifizierte und erfahrene Profis mit jahrelanger Berufserfahrung. Sie vermitteln dir in den Kursen nicht nur theoretisches Wissen, sondern teilen ihre Erfahrungen aus realen Projekten und helfen dir, das Gelernte direkt in deiner täglichen Arbeit anzuwenden. Das ist kein Werbeversprechen, sondern unser Anspruch. Am besten siehst du das in unseren Bewertungen, z.B. auch bei Google.
Keine Vorkasse
Du zahlst erst nach dem Seminar. Keine Vorkasse, keine Vorauszahlung - so kannst du sicher sein, dass du nur für das bezahlst, was du auch wirklich erhalten hast. Die Rechnung erhältst du erst nach Kursbeginn.
Max. 8 Teilnehmende
Wir setzen auf kleine Gruppen, damit du die Aufmerksamkeit bekommst, die du verdienst. So haben wir mehr Zeit für deine individuellen Fragen und können gezielt auf deine Bedürfnisse eingehen.
Termine & Buchung
Leider haben wir aktuell keine Termine geplant. Es wird wahrscheinlich bei uns etwas schief gelaufen sein - bitte kontaktiere uns und wir finden den passenden Termin.
Nicht der passende Termin dabei?
Wir finden eine Lösung: anderer Termin, mehrere Teilnehmer, Inhouse-Schulung oder individuelle Beratung.
Lieber gleich das ganze Team schulen?
Diese Schulung gibt es auch exklusiv für dein Unternehmen, bei euch vor Ort, an unseren Standorten oder Live-Online. Inhalte und Termine nach Maß.
Inhouse-Schulung
Wir kommen zu euch: diese Schulung maßgeschneidert in euren Räumen, für Unternehmen und Behörden.
- Inhalte exakt auf euch zugeschnitten
- Termine nach euren Bedürfnissen
- Günstiger ab mehreren Teilnehmern
- Vertraute Umgebung, kein Reiseaufwand
Firmen-Seminar
Exklusiv für dein Team an einem unserer Standorte oder Live-Online, individuell angepasst.
- Geschlossene Gruppe aus eurem Haus
- Individuelle Terminplanung
- An unseren Standorten oder Live-Online
- Angepasste Inhalte
Fragen und Antworten zu Apache Iceberg Schulung: Spark und Flink verbinden
Was ist Apache Iceberg?
Apache Iceberg ist ein offenes Tabellenformat für große analytische Datenbestände in Object Stores und verteilten Dateisystemen. Es verwaltet Tabellenzustände über Metadaten, Manifeste und Snapshots. Dadurch greifen Engines wie Spark und Flink auf definierte Versionen zu und führen Änderungen über atomare Commits aus.
Was ist der Unterschied zwischen Apache Iceberg und Parquet?
Parquet speichert Spaltendaten in einzelnen Dateien, Apache Iceberg verwaltet darüber die vollständige Tabelle mit Schema, Partitionierung, Snapshots und Commit-Regeln. Eine Iceberg-Tabelle nutzt häufig Parquet als Dateiformat und ergänzt Metadaten für Versionierung und parallele Schreibvorgänge.
Wofür wird ein REST Catalog bei Apache Iceberg genutzt?
Ein REST Catalog stellt Tabellen und Namespaces über eine HTTP-API für verschiedene Compute Engines bereit. Spark und Flink verwenden denselben Catalog, um Tabellen zu laden und Commits gegen den aktuellen Metadatenstand auszuführen.
Wann nutze ich Time-Travel und wann Rollback?
Time-Travel liest einen früheren Snapshot, während der aktuelle Tabellenstand erhalten bleibt. Rollback verschiebt die aktuelle Tabellenreferenz auf einen ausgewählten früheren Snapshot und eignet sich zur Rücknahme einer fehlerhaften Veröffentlichung.
Welche Vorkenntnisse brauche ich für die Apache Iceberg Schulung?
Grundkenntnisse in SQL und verteilten Datenplattformen reichen für den Einstieg in die Iceberg-Themen aus. Erste Erfahrung mit Spark oder Flink erleichtert die Laborübungen zu Batch- und Streaming-Writes.
Brauche ich ein eigenes Notebook oder Softwarelizenzen?
cmt stellt die benötigte Laborumgebung, VMs und Software für die Übungen bereit. Du brauchst kein eigenes Notebook und musst keine Spark-, Flink- oder Catalog-Lizenzen mitbringen.
Kann das Open Lakehouse Training als Firmenschulung stattfinden?
Die Schulung ist als Inhouse- oder Firmenseminar durchführbar. Spark-Version, Flink-Version, Catalog-Anbindung und Infrastruktur lassen sich nach technischer Abstimmung an euren Stack anpassen.
Gibt es Konditionen für mehrere Mitarbeiter?
cmt erstellt für mehrere Mitarbeiter ein Angebot passend zum gewünschten Format. Konditionen für Präsenz, Online-Schulung oder Inhouse-Durchführung erhältst du auf Anfrage.
Weitere häufig gestellte Fragen und Antworten findest du in den FAQs .
Unser Qualitätsversprechen: Wissen, das in der Praxis funktioniert
Aus der Praxis für die Praxis
Schluss mit theoretischem Ballast. Wir trainieren dich für reale IT-Herausforderungen, nicht für Multiple-Choice-Tests. Unsere Trainer vermitteln dir genau das Wissen, das am nächsten Montagmorgen im Job wirklich funktioniert.
Individuell statt "Schema F"
Deine Fragen passen nicht ins Standard-Skript? Bei uns schon. Wir verzichten auf starre Lehrpläne und geben deinen konkreten Projekt-Fragen Raum. Unsere Trainer passen die Inhalte flexibel an das an, was dich und dein Team aktuell weiterbringt.
Maximale Freiheit: Remote oder vor Ort
Lerne so, wie es in deinen Alltag passt - ohne Reise-Stress und Zeitverlust. Egal ob remote, hybrid oder präsent vor Ort: Wir garantieren dir ein nahtloses und effektives Lernerlebnis, egal von wo du dich zuschaltest.
Mit Zufriedenheitsgarantie
Wir sind von unserer Qualität überzeugt - und wollen, dass du es auch bist. Sollte ein Training einmal nicht deinen Erwartungen entsprechen, bieten wir dir an, den Kurs kostenlos zu wiederholen oder ein anderes Training zu besuchen. Ohne Risiko, ohne Diskussion.
NOCH FRAGEN?
Rufe mich an oder schreibe mir eine E-Mail.
Michaela Berger
Über 20.000 Unternehmen und Behörden vertrauen auf uns