Data Engineering in der Google Cloud
Sammeln Sie praktische Erfahrungen mit dem Entwurf und der Entwicklung von Datenverarbeitungssystemen in Google Cloud. Dieser Kurs vermittelt Ihnen anhand von Präsentationen, Demos und praktischen Übungen, wie Sie Datenverarbeitungssysteme entwerfen, End-to-End-Datenpipelines erstellen, Daten analysieren und maschinelles Lernen implementieren. Dieser Kurs behandelt strukturierte, unstrukturierte und Streaming-Daten.
- Dauer: 4 Tage
- Sprachen: Englisch, Deutsch
- Niveau: Fortgeschritten
- Gruppengröße: Bis zu 16
Das lernen Sie
- Skalierbare Datenverarbeitungssysteme in Google Cloud entwerfen.
- Datenarchitekturen unterscheiden und Data-Lakehouse- und Pipeline-Konzepte implementieren.
- Robuste Streaming- und Batch-Datenpipelines erstellen und verwalten.
- KI/ML-Tools nutzen, um die Leistung zu optimieren und Prozess- und Dateneinblicke zu gewinnen.
Voraussetzungen
- Verständnis von Data-Engineering-Prinzipien, einschließlich ETL/ELT-Prozessen, Datenmodellierung und gängigen Datenformaten (Avro, Parquet, JSON).
- Vertrautheit mit Konzepten der Datenarchitektur, insbesondere Data Warehouses und Data Lakes.
- Sicherheit in SQL für die Datenabfrage.
- Sicherheit in einer gängigen Programmiersprache (Python empfohlen).
- Vertrautheit mit der Verwendung von Befehlszeilenschnittstellen (CLI).
- Vertrautheit mit den Kernkonzepten und Diensten von Google Cloud (Compute, Storage und Identitätsmanagement).
Kursinhalt
Data-Engineering-Aufgaben und -Komponenten
- Die Rolle eines Dateningenieurs
- Datenquellen versus Datensenken
- Datenformate
- Optionen für Speicherlösungen auf Google Cloud
- Optionen für die Metadatenverwaltung auf Google Cloud
- Freigabe von Datasets mit Analytics Hub
Datenreplikation und -migration
- Replikations- und Migrationsarchitektur
- Das Befehlszeilentool gcloud
- Verschieben von Datasets
- Datastream
Das Extract-and-Load-Datenpipeline-Muster
- Extract-and-Load-Architektur
- Das bq-Befehlszeilentool
- BigQuery Data Transfer Service
- BigLake
Das Extract, Load und Transform (ELT)-Datenpipeline-Muster
- Extract, Load und Transform (ELT)-Architektur
- SQL-Skripting und -Planung mit BigQuery
- Dataform
Das Extract, Transform und Load (ETL)-Datenpipeline-Muster
- Extract, Transform und Load (ETL)-Architektur
- Google Cloud GUI-Tools für ETL-Datenpipelines
- Batch-Datenverarbeitung mit Dataproc
- Optionen für die Streaming-Datenverarbeitung
- Bigtable und Datenpipelines
Automatisierungstechniken
- Automatisierungsmuster und -optionen für Pipelines
- Cloud Scheduler und Workflows
- Cloud Composer
- Cloud Run Functions
- Eventarc
Einführung in modernes Data Engineering auf Google Cloud
- Die Klassiker: Data Lakes und Data Warehouses
- Der moderne Ansatz: Data Lakehouse
- Die richtige Architektur wählen
Erstellen eines Data Lakehouse mit Cloud Storage, offenen Formaten und BigQuery
- Erstellen einer Data Lake-Grundlage
- Einführung in das offene Tabellenformat Apache Iceberg
- BigQuery als zentrale Verarbeitungsmaschine
- Kombinieren von Betriebsdaten in AlloyDB
- Kombinieren von Betriebs- und Analysedaten mit föderierten Abfragen
- Praktischer Anwendungsfall
Modernisierung von Data Warehouses mit BigQuery und BigLake
- BigQuery-Grundlagen
- Partitionierung und Clustering in BigQuery
- Einführung in BigLake und externe Tabellen
Erweiterte Lakehouse-Muster und Data Governance
- Data Governance und Sicherheit in einer einheitlichen Plattform
- Demo: Data Loss Prevention
- Analysen und maschinelles Lernen auf dem Lakehouse
- Praktische Lakehouse-Architekturen und Migrationsstrategien
Labs und Best Practices
- Überprüfung
- Best Practices
Wann Batch-Datenpipelines zu wählen sind
- Batch-Datenpipelines und ihre Anwendungsfälle
- Verarbeitung und häufige Herausforderungen
Skalierbare Batch-Datenpipelines entwerfen und erstellen
- Batch-Pipelines entwerfen
- Große Datentransformationen
- Dataflow und Serverless für Apache Spark
- Datenverbindungen und Orchestrierung
- Eine Apache Spark-Pipeline ausführen
- Batch-Pipeline-Leistung optimieren
Datenqualität in Batch-Datenpipelines kontrollieren
- Batch-Datenvalidierung und -bereinigung
- Fehler protokollieren und analysieren
- Schema-Evolution für Batch-Pipelines
- Datenintegrität und Duplizierung
- Deduplizierung mit Serverless für Apache Spark
- Deduplizierung mit Dataflow
Batch-Datenpipelines orchestrieren und überwachen
- Orchestrierung für die Batch-Verarbeitung
- Cloud Composer
- Vereinheitlichte Beobachtbarkeit
- Alarme und Fehlerbehebung
- Visuelle Pipeline-Verwaltung
Kurseinführung
- Lernziele des Kurses
- Kursvoraussetzungen
- Der Anwendungsfall, das Unternehmen, die Herausforderung und die Mission
Streaming-Anwendungsfälle und Referenzarchitekturen
- Einführung in Streaming-Datenpipelines auf Google Cloud
- Streaming ETL
- Streaming AI/ML
- Streaming-Anwendungen
- Reverse ETL
Detaillierte Produktanalysen
- Architektonische Überlegungen für Pub/Sub und Managed Service für Apache Kafka
- Dataflow: Das Verarbeitungs-Kraftpaket
- BigQuery: Die Analyse-Engine
- Bigtable: Die Lösung für Betriebsdaten
Wichtige Erkenntnisse
- Was Sie erreicht haben
- Nächste Schritte
Passende Kurse
AlloyDB Grundlagen
Dieser Kurs beleuchtet die Vorteile von AlloyDB, insbesondere im Vergleich zu PostgreSQL in Cloud SQL. Er führt Sie durch die Architektur von AlloyDB und erklärt, wie Sie Deployments in Google Cloud konfigurieren.Der Kurs ist in zwei Teile gegliedert: AlloyDB Administration Essentials (Architektur und Konfiguration) und AlloyDB Optimization Essentials (Leistungsoptimierung).
BigQuery für Data Analysts
Dieser Kurs richtet sich an Datenanalysten, die lernen möchten, wie sie BigQuery für ihre Analyseanforderungen nutzen können. Durch eine Kombination aus Präsentationen, Übungen und Demos behandeln wir verschiedene Themen, die erörtern, wie Sie Ihre Daten in BigQuery erfassen, transformieren und abfragen können, um Erkenntnisse zu gewinnen, die bei Geschäftsentscheidungen hilfreich sein können.
Datenintegration mit Cloud Data Fusion
Dieser zweitägige Kurs führt die Teilnehmer in die Datenintegrationsfunktionen von Google Cloud mithilfe von Cloud Data Fusion ein. In diesem Kurs besprechen wir die Herausforderungen der Datenintegration und die Notwendigkeit einer Datenintegrationsplattform (Middleware). Anschließend erörtern wir, wie Cloud Data Fusion dabei helfen kann, Daten aus verschiedenen Quellen und Formaten effektiv zu integrieren und Erkenntnisse zu gewinnen. Wir werfen einen Blick auf die Hauptkomponenten von Cloud Data Fusion und deren Funktionsweise, wie man Batch-Daten und Echtzeit-Streaming-Daten mit visuellem Pipeline-Design, umfassender Nachverfolgung von Metadaten und Datenherkunft verarbeitet und wie man Datenpipelines auf verschiedenen Ausführungs-Engines bereitstellt.
Unsicher, welcher Kurs passt?
Buchen Sie ein 30-minütiges Gespräch. Wir schauen uns an, wo Ihr Team steht und was es können muss — und stellen daraus einen konkreten Kurstermin oder einen passenden Lernplan zusammen.