As a Systems Engineer (SRE), you will design, implement, and maintain CI/CD pipelines, manage cloud resources, and automate infrastructure to enhance system performance and reliability.
Analista de Infraestrutura de TI II (Observabilidade / SRE)
📜 Description
- Gerenciar e modernizar a plataforma de observabilidade com Zabbix e ElasticSearch.
- Implantar e distribuir o agente do OpenTelemetry em todos os componentes monitoráveis.
- Configurar e instrumentar módulos avançados de telemetria para coleta e análise de dados.
- Criar e customizar dashboards executivos e técnicos, estruturando alertas inteligentes.
- Apoiar na definição e monitoramento de indicadores operacionais e de negócio.
- Desenvolver automações para solução proativa de problemas e autorremediação de incidentes.
🛠️ Requirements
- Experiência prévia consolidada como Analista de Monitoramento, Observabilidade, DevOps ou SysAdmin em nível Pleno.
- Experiência prática na operação e sustentação de Zabbix e ElasticSearch (ou stack ELK).
- Experiência com ferramentas modernas como DataDog e Grafana.
- Conhecimento prático em conceitos e arquitetura de OpenTelemetry.
- Sólido entendimento dos três pilares da observabilidade: Métricas, Logs e Traces.
- Habilidade para criar consultas e estruturar dashboards em ferramentas de visualização de dados.
- Experiência com desenvolvimento de scripts ou automações para resolução de problemas (Python, Shell Script, Go ou similares).
- Ensino superior completo.
Full job description
Buscamos um(a) Analista de Observabilidade Pleno para protagonizar a evolução da nossa infraestrutura de monitoramento. Em pleno cenário pós-privatização, a Sabesp acelera sua transformação digital para atingir metas globais de eficiência.
Sua missão será nos ajudar a aumentar o nosso nível de maturidade em observabilidade e estabilidade, conectando ferramentas consolidadas (Zabbix e Elastic) a uma arquitetura moderna baseada em DataDog, Grafana e OpenTelemetry. Se você é movido por automação, dados em tempo real e resolução inteligente de problemas complexos em cenários de alta disponibilidade, seu lugar é aqui.
Responsibilities
- Gerenciar e modernizar a plataforma de observabilidade, atuando tanto na operação das ferramentas (Zabbix e ElasticSearch) quanto na implantação e evolução da stack moderna (DataDog e Grafana).
- Implementar e distribuir o agente do OpenTelemetry (OTel) em todos os componentes monitoráveis da companhia, abrangendo camadas de Sistemas (APM) e Infraestrutura.
- Configurar e instrumentar módulos avançados de telemetria, garantindo a correta coleta, correlação e análise de métricas, logs e traces.
- Criar e customizar dashboards executivos e técnicos, além de estruturar alertas inteligentes para mitigar falsos positivos.
- Apoiar na definição, revisão e monitoramento de indicadores operacionais e de negócio (SLIs, SLOs e SLAs).
- Acompanhar eventos de Causa Raiz (RCA) e conduzir agendas de post-mortem junto aos times de tecnologia para propor melhorias contínuas no monitoramento.
- Desenvolver automações para a solução proativa de problemas e autorremediação de incidentes (self-healing).
- Acompanhar e apoiar na gestão de contratos com fornecedores e parceiros de soluções de observabilidade.
Requirements
Obrigatórios:
- Experiência prévia consolidada como Analista de Monitoramento, Observabilidade, DevOps ou SysAdmin em nível Pleno.
- Experiência prática na operação e sustentação de Zabbix e ElasticSearch (ou stack ELK).
- Experiência com ferramentas modernas de mercado DataDog e Grafana.
- Conhecimento prático em conceitos e arquitetura de OpenTelemetry (distribuição de agentes, coletores e instrumentação).
- Sólido entendimento dos três pilares da observabilidade: Métricas, Logs e Traces.
- Habilidade para criar consultas e estruturar dashboards em ferramentas de visualização de dados.
- Experiência com desenvolvimento de scripts ou automações para resolução de problemas (Python, Shell Script, Go ou similares).
- Ensino superior completo.
Desejáveis:
- Conhecimento prático em conceitos de SRE (Confiabilidade de Sites) e facilitação de dinâmicas de post-mortem.
- Familiaridade com ferramentas de Infraestrutura como Código (Terraform ou Ansible) para deploy de agentes.
- Certificações oficiais em ferramentas de observabilidade (ex: Datadog Fundamentals, Grafana Certified Certified Associate ou equivalentes).
- Desejável Carteira Nacional de Habilitação - CNH.
Similar jobs
Search more Site Reliability Engineer jobsSite Reliability Engineer, Platform Infrastructure (Foundations)
As a Site Reliability Engineer, you will design and optimize critical infrastructure for distributed AI applications, ensuring high performance and reliability in cloud environments.
As a SRE Specialist, you will define product infrastructure, ensure system resilience, and manage SLIs, SLAs, and SLOs while troubleshooting applications and directing monitoring solutions.
As a Site Reliability Engineer, you'll design, automate, and manage production systems for Kong's multi-region SaaS platform, ensuring reliability and performance across various cloud environments.
As a Site Reliability Engineer II, you will design, automate, and manage the core container stack and infrastructure, ensuring reliability and efficiency for global business applications.
