Curso Google Cloud Professional Data Engineer

  • Cloud Computing

Curso Google Cloud Professional Data Engineer

32 horas
Visão Geral

O curso Google Cloud Professional Data Engineer (GCP-PDE-201) prepara profissionais para projetar, implementar, operacionalizar, proteger, monitorar e otimizar soluções modernas de engenharia de dados utilizando os serviços do Google Cloud Platform (GCP).

A formação aborda todo o ciclo de vida dos dados, desde a ingestão e processamento de dados em lote e streaming até armazenamento, modelagem, análise, governança, segurança, automação e monitoramento de workloads de dados.

Durante o treinamento, os participantes trabalham com tecnologias e serviços como BigQuery, Cloud Storage, Pub/Sub, Dataflow, Dataproc/Managed Service for Apache Spark, Cloud SQL, Bigtable, Dataplex/Knowledge Catalog, BigQuery ML e Managed Service for Apache Airflow, além de ferramentas de monitoramento, segurança e automação. O ecossistema atual de treinamento do Google Cloud também destaca BigQuery, Dataflow, Data Fusion, Managed Service for Apache Airflow, BigQuery ML e Managed Service for Apache Spark para a formação de Data Engineers.

A formação combina conceitos arquiteturais, boas práticas de engenharia de dados, estudos de caso e laboratórios Hands-On, permitindo ao participante desenvolver soluções de dados escaláveis, confiáveis, seguras e orientadas a requisitos de negócio.

O conteúdo também contempla preparação direcionada para a certificação Google Cloud Professional Data Engineer, cujo exame atual possui duração de 2 horas, 40–50 questões de múltipla escolha e seleção múltipla, sem pré-requisitos formais, embora o Google recomende experiência profissional relevante em cloud e pelo menos um ano projetando e gerenciando soluções no Google Cloud.

Objetivo

Após realizar este curso Google Cloud Professional Data Engineer (GCP-PDE-201), você será capaz de:

  • Projetar arquiteturas modernas de processamento de dados no Google Cloud
  • Selecionar serviços GCP adequados para diferentes workloads de dados
  • Projetar pipelines de dados batch e streaming
  • Implementar processos de ingestão, transformação e processamento de dados
  • Trabalhar com BigQuery para data warehousing e analytics
  • Utilizar Cloud Storage em arquiteturas de data lake
  • Implementar soluções utilizando Dataflow e Apache Beam
  • Trabalhar com processamento distribuído utilizando Apache Spark
  • Utilizar Pub/Sub em arquiteturas de streaming e event-driven
  • Projetar modelos de dados para workloads analíticos
  • Implementar estratégias de particionamento e clustering no BigQuery
  • Otimizar consultas e workloads de dados
  • Implementar soluções de dados escaláveis, resilientes e de alta disponibilidade
  • Aplicar controles de IAM e segurança em ambientes de dados
  • Implementar criptografia e proteção de dados
  • Aplicar princípios de governança, classificação e ciclo de vida dos dados
  • Utilizar Dataplex/Knowledge Catalog para organização e governança de dados
  • Preparar dados para análise e aplicações de Machine Learning
  • Utilizar BigQuery ML em cenários de análise e Machine Learning
  • Monitorar pipelines e workloads de dados
  • Automatizar operações de engenharia de dados
  • Identificar e solucionar problemas de performance e confiabilidade
  • Avaliar custos e otimizar workloads de dados no Google Cloud
  • Preparar-se tecnicamente para o exame Google Cloud Professional Data Engineer
Publico Alvo
  • Data Engineers
  • Engenheiros de Dados
  • Data Architects
  • Cloud Architects
  • Cloud Engineers
  • Data Analysts com experiência em ambientes cloud
  • Database Administrators
  • Desenvolvedores envolvidos com plataformas de dados
  • Profissionais de Big Data e Analytics
  • Profissionais de Machine Learning que trabalham com dados em escala
  • Profissionais responsáveis por pipelines de dados e plataformas analíticas
  • Profissionais que desejam se preparar para a certificação Google Cloud Professional Data Engineer
Pre-Requisitos
  • Conhecimentos fundamentais de Google Cloud Platform
  • Experiência com processamento de dados ou sistemas de banco de dados
  • Conhecimentos de SQL
  • Conhecimentos básicos de programação, preferencialmente Python
  • Conhecimentos de conceitos de ETL/ELT
  • Conhecimentos básicos de data warehouses e data lakes
  • Familiaridade com conceitos de Big Data e Analytics
  • Conhecimentos básicos de Machine Learning são recomendados

Para melhor aproveitamento, recomenda-se experiência prática anterior com ambientes de nuvem. O Google atualmente recomenda três anos ou mais de experiência no setor, incluindo pelo menos um ano projetando e gerenciando soluções utilizando Google Cloud.

Materiais
Inglês/Português + Exercícios + Lab Pratico
Conteúdo Programatico

Module 1: Fundamentos de Data Engineering no Google Cloud

1.1 Data Engineering e arquitetura moderna de dados
1.2 Características de workloads analíticos e operacionais
1.3 Data Lake, Data Warehouse e Lakehouse
1.4 Arquiteturas batch, streaming e híbridas
1.5 ETL, ELT e ELT moderno
1.6 Data-driven architecture
1.7 Seleção de serviços Google Cloud para workloads de dados
1.8 Google Cloud Console, Cloud Shell e Google Cloud CLI
1.9 Organização, projetos, regiões e zonas
1.10 Hands-On: configuração do ambiente de Data Engineering

Module 2: Data Storage e Data Management

2.1 Cloud Storage para data lakes
2.2 Classes de armazenamento e lifecycle management
2.3 BigQuery como plataforma analítica
2.4 Cloud SQL
2.5 Cloud Spanner
2.6 Bigtable
2.7 Firestore
2.8 Escolha do armazenamento adequado ao workload
2.9 Structured, semi-structured e unstructured data
2.10 OLTP versus OLAP
2.11 Estratégias de retenção e ciclo de vida
2.12 Hands-On: implementação de uma arquitetura de armazenamento

Module 3: BigQuery Data Warehouse

3.1 Arquitetura do BigQuery
3.2 Datasets e tabelas
3.3 Schemas e tipos de dados
3.4 SQL no BigQuery
3.5 Views e materialized views
3.6 External tables
3.7 Particionamento
3.8 Clustering
3.9 Joins e agregações
3.10 Performance de consultas
3.11 Controle de custos
3.12 BigQuery Storage e Compute
3.13 BigQuery BI Engine
3.14 Hands-On: construção de um Data Warehouse no BigQuery

Module 4: Data Ingestion e Data Integration

4.1 Estratégias de ingestão de dados
4.2 Batch ingestion
4.3 Streaming ingestion
4.4 Pub/Sub
4.5 Conectividade entre fontes e destinos
4.6 Data Fusion
4.7 Transferência de dados para o Google Cloud
4.8 APIs e fontes externas
4.9 CDC — Change Data Capture
4.10 Tratamento de dados duplicados
4.11 Idempotência
4.12 Hands-On: implementação de pipeline de ingestão

Module 5: Data Processing com Dataflow e Apache Beam

5.1 Introdução ao Dataflow
5.2 Apache Beam
5.3 Batch pipelines
5.4 Streaming pipelines
5.5 PCollections
5.6 Transforms
5.7 ParDo e funções de processamento
5.8 Windowing
5.9 Triggers
5.10 Watermarks
5.11 Event time e processing time
5.12 Tratamento de dados atrasados
5.13 Escalabilidade e autoscaling
5.14 Monitoring de pipelines Dataflow
5.15 Hands-On: construção de pipeline batch
5.16 Hands-On: construção de pipeline streaming

Module 6: Big Data Processing com Apache Spark

6.1 Conceitos de processamento distribuído
6.2 Apache Spark
6.3 Managed Service for Apache Spark
6.4 Spark DataFrames
6.5 Spark SQL
6.6 Processamento distribuído
6.7 Data transformation
6.8 Performance e particionamento
6.9 Integração com Cloud Storage e BigQuery
6.10 Migração de workloads Hadoop/Spark
6.11 Hands-On: processamento distribuído de datasets

Module 7: Data Modeling e Data Analytics

7.1 Princípios de modelagem de dados analíticos
7.2 Dimensional modeling
7.3 Star schema
7.4 Snowflake schema
7.5 Normalização e desnormalização
7.6 Data marts
7.7 Dados históricos
7.8 Data quality
7.9 Data cleansing
7.10 Data enrichment
7.11 Preparação de dados para Analytics
7.12 Preparação de dados para Machine Learning

Module 8: Data Governance, Security e Compliance

8.1 Data governance
8.2 IAM aplicado a dados
8.3 Roles e permissions
8.4 Service Accounts
8.5 Princípio do menor privilégio
8.6 Criptografia de dados
8.7 Customer-managed encryption keys
8.8 Secret management
8.9 Controle de acesso a datasets
8.10 Proteção de dados sensíveis
8.11 PII e dados regulamentados
8.12 Data classification
8.13 Data lineage
8.14 Data discovery
8.15 Dataplex/Knowledge Catalog
8.16 Auditoria e Cloud Audit Logs

Module 9: Machine Learning e BigQuery ML

9.1 Machine Learning aplicado à engenharia de dados
9.2 Preparação de datasets para ML
9.3 BigQuery ML
9.4 Criação de modelos utilizando SQL
9.5 Feature engineering
9.6 Treinamento e avaliação de modelos
9.7 Predições
9.8 Integração entre BigQuery e Machine Learning
9.9 Pipelines de dados para ML
9.10 Considerações de segurança e governança em workloads de ML
9.11 Hands-On: criação de modelo utilizando BigQuery ML

Module 10: Data Operations, Monitoring e Reliability

10.1 Data workload operations
10.2 Cloud Monitoring
10.3 Cloud Logging
10.4 Métricas e alertas
10.5 Monitoramento de pipelines
10.6 Data quality monitoring
10.7 Troubleshooting
10.8 Falhas e recuperação de pipelines
10.9 Retry e error handling
10.10 Alta disponibilidade
10.11 Resiliência e fault tolerance
10.12 Disaster recovery para plataformas de dados
10.13 Hands-On: monitoramento e troubleshooting de pipeline

Module 11: Automação e Orquestração de Data Workloads

11.1 Automação de workloads
11.2 Managed Service for Apache Airflow
11.3 DAGs e workflows
11.4 Agendamento de pipelines
11.5 Dependências entre tarefas
11.6 Data pipeline orchestration
11.7 Integração entre Airflow, BigQuery, Cloud Storage e Dataflow
11.8 Automação utilizando APIs e CLI
11.9 Infrastructure as Code para ambientes de dados
11.10 Hands-On: criação e execução de workflow de dados

Module 12: Performance, Scalability e Cost Optimization

12.1 Dimensionamento de workloads
12.2 Escalabilidade horizontal e vertical
12.3 Otimização de BigQuery
12.4 Particionamento e clustering
12.5 Otimização de Dataflow
12.6 Otimização de Spark
12.7 Gerenciamento de armazenamento
12.8 Controle de consumo de recursos
12.9 Cost optimization
12.10 Monitoring de custos
12.11 Capacity planning
12.12 Trade-offs entre performance, custo e confiabilidade

Module 13: Arquiteturas de Data Engineering

13.1 Arquitetura de Data Lake
13.2 Arquitetura de Data Warehouse
13.3 Arquitetura Lakehouse
13.4 Batch Data Processing Architecture
13.5 Streaming Data Architecture
13.6 Lambda Architecture
13.7 Event-driven data architecture
13.8 Modern Data Platform
13.9 Data Mesh e governança distribuída
13.10 Arquiteturas híbridas
13.11 Integração com ambientes on-premises
13.12 Estudos de caso empresariais
13.13 Hands-On: desenho de arquitetura completa de Data Engineering

Module 14: Preparação para a Certificação Professional Data Engineer

14.1 Estrutura e características do exame
14.2 Revisão dos domínios da certificação
14.3 Design de sistemas de processamento de dados
14.4 Ingestão e processamento de dados
14.5 Armazenamento de dados
14.6 Preparação e utilização de dados para análise
14.7 Manutenção e automação de workloads
14.8 Estudos de caso
14.9 Cenários de arquitetura e tomada de decisão
14.10 Questões práticas e análise das respostas
14.11 Estratégias para resolução de questões
14.12 Simulado final
14.13 Revisão dos principais pontos técnicos

TENHO INTERESSE

Cursos Relacionados

Curso Android Desenvolvendo Apps

40 horas

Curso AWS Amazon Solution Architect

horas

Curso AWS Desenvolvedor Advanced

24 horas

Curso OpenStack Private Cloud Administration

32 horas

Curso AWS Technical Essentials

8 horas