Google Cloud Schulung

Serverless Data Processing mit Dataflow

Dieses Training richtet sich an Big-Data-Experten, die ihr Verständnis von Dataflow erweitern möchten, um ihre Datenverarbeitungsanwendungen zu verbessern. Beginnend mit den Grundlagen erklärt dieses Training, wie Apache Beam und Dataflow zusammenarbeiten, um Ihre Datenverarbeitungsanforderungen ohne das Risiko eines Vendor Lock-ins zu erfüllen. Der Abschnitt zur Entwicklung von Pipelines behandelt, wie Sie Ihre Geschäftslogik in Datenverarbeitungsanwendungen umwandeln, die auf Dataflow ausgeführt werden können. Dieses Training gipfelt in einem Fokus auf Operationen, der die wichtigsten Lektionen für den Betrieb einer Datenanwendung auf Dataflow überprüft, einschließlich Überwachung, Fehlerbehebung, Tests und Zuverlässigkeit.

  • Dauer: 3 Tage
  • Sprachen: Englisch, Deutsch
  • Niveau: Experte
  • Gruppengröße: Bis zu 16

Das lernen Sie

  • Demonstrieren Sie, wie Apache Beam und Dataflow zusammenarbeiten, um die Datenverarbeitungsanforderungen Ihres Unternehmens zu erfüllen.
  • Fassen Sie die Vorteile des Beam Portability Frameworks zusammen und aktivieren Sie es für Ihre Dataflow-Pipelines.
  • Aktivieren Sie Shuffle und Streaming Engine für Batch- bzw. Streaming-Pipelines, um maximale Leistung zu erzielen.
  • Aktivieren Sie Flexible Resource Scheduling für eine kostengünstigere Leistung.
  • Wählen Sie die richtige Kombination von IAM-Berechtigungen für Ihren Dataflow-Job.
  • Implementieren Sie Best Practices für eine sichere Datenverarbeitungsumgebung.
  • Wählen und optimieren Sie die E/A Ihrer Wahl für Ihre Dataflow-Pipeline.
  • Verwenden Sie Schemata, um Ihren Beam-Code zu vereinfachen und die Leistung Ihrer Pipeline zu verbessern.
  • Entwickeln Sie eine Beam-Pipeline mit SQL und DataFrames.
  • Führen Sie Überwachung, Fehlerbehebung, Tests und CI/CD für Dataflow-Pipelines durch.

Voraussetzungen

  • „Batch-Datenpipelines erstellen“ abgeschlossen.
  • „Robuste Streaming-Analyse-Systeme erstellen“ abgeschlossen.

Kursinhalt

Einführung
  • Kurseinführung
  • Beam- und Dataflow-Auffrischung
Beam-Portabilität
  • Beam-Portabilität
  • Runner v2
  • Container-Umgebungen
  • Sprachübergreifende Transformationen
Trennung von Compute und Storage mit Dataflow
  • Dataflow Shuffle Service
  • Dataflow Streaming Engine
  • Flexible Ressourcenzuweisung
IAM, Quoten und Berechtigungen
  • IAM
  • Quote
Sicherheit
  • Datenlokalität
  • Shared VPC
  • Private IPs
  • CMEK
Wiederholung der Beam-Konzepte
  • Beam-Grundlagen
  • Dienstprogramm-Transformationen
  • DoFn-Lebenszyklus
Fenster, Wasserzeichen, Trigger
  • Fenster
  • Wasserzeichen
  • Trigger
Quellen und Senken
  • Quellen und Senken
  • Text IO und File IO
  • BigQuery IO
  • PubSub IO
  • Kafka IO
  • Bigtable IO
  • Avro IO
  • Splittable DoFn
Schemata
  • Beam-Schemata
  • Codebeispiele
Zustand und Timer
  • State API
  • Timer API
  • Zusammenfassung
Best Practices
  • Schemata
  • Umgang mit nicht verarbeitbaren Daten
  • Fehlerbehandlung
  • AutoValue Code Generator
  • Umgang mit JSON-Daten
  • Nutzung des DoFn-Lebenszyklus
  • Pipeline-Optimierungen
Dataflow SQL und DataFrames
  • Dataflow und Beam SQL
  • Windowing in SQL
  • Beam DataFrames
Beam-Notebooks
  • Beam-Notebooks
Überwachung
  • Jobliste
  • Jobinformationen
  • Jobgraph
  • Jobmetriken
  • Metrik-Explorer
Protokollierung und Fehlerberichterstattung
  • Protokollierung
  • Fehlerberichterstattung
Fehlerbehebung und Debugging
  • Workflow zur Fehlerbehebung
  • Arten von Problemen
Leistung
  • Pipeline-Design
  • Datenform
  • Quellen, Senken und externe Systeme
  • Shuffle und Streaming Engine
Testen und CI/CD
  • Übersicht Testen und CI/CD
  • Unit-Tests
  • Integrationstests
  • Artefakt-Erstellung
  • Bereitstellung
Zuverlässigkeit
  • Einführung in die Zuverlässigkeit
  • Überwachung
  • Geolokalisierung
  • Disaster Recovery
  • Hochverfügbarkeit
Flexible Templates
  • Klassische Templates
  • Flexible Templates
  • Verwendung flexibler Templates
  • Von Google bereitgestellte Templates
Zusammenfassung
  • Zusammenfassung

Passende Kurse

Data Engineering Solutions Lab (DSL)

Das Data Engineering Solutions Lab (DSL) ist eine 10-tägige, fokussierte, immersive Lernerfahrung, die Ihr Team schnell in den Prinzipien und Best Practices des Google Cloud Data Engineering weiterbildet. Das Programm kombiniert fünf Tage lang von Experten geleitete Schulungen zu wichtigen Data-Engineering-Konzepten (z. B. Data Warehousing, Pipelines, Datenqualität) mit praktischen Übungen und einem fünftägigen kollaborativen Abschlussprojekt. Das Abschlussprojekt fordert die Teilnehmer heraus, einen realen Anwendungsfall mithilfe von Google Cloud-Tools zu lösen.

  • Dauer: 10 Tage
  • Sprachen: Englisch, Deutsch
  • Niveau: Experte

Looker Entwickler Deep Dive

LookML dient als Grundlage für Visualisierungs-Assets in Looker und ermöglicht dynamische Aggregationen, inkrementell aktualisierte persistente abgeleitete Tabellen und mehr. In diesem Kurs üben Sie die Fähigkeiten, die Sie als fortgeschrittener Looker-Entwickler benötigen, durch geführte Vorlesungen und unabhängige Übungen mit Beispieldaten.

  • Dauer: 2 Tage
  • Sprachen: Englisch, Deutsch
  • Niveau: Experte

AlloyDB Grundlagen

Dieser Kurs beleuchtet die Vorteile von AlloyDB, insbesondere im Vergleich zu PostgreSQL in Cloud SQL. Er führt Sie durch die Architektur von AlloyDB und erklärt, wie Sie Deployments in Google Cloud konfigurieren.Der Kurs ist in zwei Teile gegliedert: AlloyDB Administration Essentials (Architektur und Konfiguration) und AlloyDB Optimization Essentials (Leistungsoptimierung).

  • Dauer: 3 Stunden
  • Sprachen: Englisch, Deutsch
  • Niveau: Fortgeschritten

Unsicher, welcher Kurs passt?

Buchen Sie ein 30-minütiges Gespräch. Wir schauen uns an, wo Ihr Team steht und was es können muss — und stellen daraus einen konkreten Kurstermin oder einen passenden Lernplan zusammen.