Visão Geral
Este curso aborda os fundamentos e as práticas de monitoramento de plataformas de mensageria e Event Streaming. O participante aprenderá a definir métricas, indicadores e alertas para brokers, producers, consumers, queues, topics, partitions e clusters distribuídos. O conteúdo explora monitoramento de throughput, latency, consumer lag, queue depth, recursos de infraestrutura, replicação e disponibilidade, além da utilização de logs, métricas e traces para observabilidade. Também serão abordadas ferramentas como Prometheus e Grafana e estratégias de monitoramento para Apache Kafka, RabbitMQ e Apache Pulsar.
Objetivo
Após realizar este curso, você será capaz de:
- Estruturar uma estratégia de monitoramento para plataformas de mensageria
- Identificar as principais métricas de brokers, producers e consumers
- Monitorar throughput, latency, consumer lag e queue depth
- Monitorar disponibilidade, replicação e saúde dos clusters
- Criar dashboards operacionais
- Definir alertas para falhas e degradação de desempenho
- Utilizar métricas, logs e traces para análise de problemas
- Implementar monitoramento com Prometheus e Grafana
- Desenvolver estratégias de observabilidade para ambientes de produção
Publico Alvo
- Administradores de Message Brokers
- Engenheiros de SRE
- Engenheiros DevOps
- Engenheiros de Cloud
- Engenheiros de Streaming
- Engenheiros de Plataforma
- Engenheiros de Infraestrutura
- Administradores de Middleware
- Arquitetos de Soluções
Pre-Requisitos
- Conhecimentos básicos de message brokers
- Familiaridade com Apache Kafka, RabbitMQ ou Apache Pulsar
- Conhecimentos básicos de Linux e redes
- Noções de métricas e logs
- Conhecimentos básicos de Prometheus e Grafana são recomendados
Conteúdo Programatico
Module 1: Messaging Monitoring Fundamentals
- Messaging observability concepts
- Monitoring versus observability
- Monitoring architecture
- Key Performance Indicators
- Service Level Indicators
- Messaging Service Level Objectives
- Monitoring strategy
Module 2: Broker and Cluster Monitoring
- Broker health
- Cluster availability
- CPU and memory utilization
- Disk usage and I/O
- Network utilization
- Connection monitoring
- Replication health
Module 3: Producer and Consumer Monitoring
- Producer throughput
- Producer latency
- Consumer throughput
- Consumer latency
- Consumer errors
- Consumer lag
- Consumer Group health
Module 4: Queue, Topic and Partition Monitoring
- Queue depth
- Topic monitoring
- Partition health
- Partition distribution
- Message rates
- Message retention
- Undelivered and failed messages
Module 5: Metrics, Logs and Traces
- Metrics collection
- Structured logging
- Distributed tracing
- Correlation identifiers
- Error tracking
- Event flow observability
- End-to-end monitoring
Module 6: Prometheus and Grafana
- Prometheus architecture
- Metrics exporters
- Prometheus scraping
- PromQL fundamentals
- Grafana dashboards
- Alerting
- Messaging monitoring dashboards
Module 7: Platform-Specific Monitoring
- Apache Kafka monitoring
- Kafka Consumer Lag monitoring
- Kafka Connect monitoring
- RabbitMQ monitoring
- RabbitMQ queue and node monitoring
- Apache Pulsar monitoring
- Pulsar broker and storage monitoring
Module 8: Monitoring and Alerting Workshop
- Monitoring architecture design
- Metrics collection configuration
- Prometheus integration
- Grafana dashboard development
- Alert rule configuration
- Incident detection and analysis
- Final messaging monitoring implementation exercise
TENHO INTERESSE