Remote Jobs RockRemote Jobs Rock

Analista de Infraestrutura de TI II (Observabilidade / SRE)

🕒 yesterday
ZabbixElasticsearchDatadogGrafana

📜 Description

  • Gerenciar e modernizar a plataforma de observabilidade com Zabbix e ElasticSearch.
  • Implantar e distribuir o agente do OpenTelemetry em todos os componentes monitoráveis.
  • Configurar e instrumentar módulos avançados de telemetria para coleta e análise de dados.
  • Criar e customizar dashboards executivos e técnicos, estruturando alertas inteligentes.
  • Apoiar na definição e monitoramento de indicadores operacionais e de negócio.
  • Desenvolver automações para solução proativa de problemas e autorremediação de incidentes.

🛠️ Requirements

  • Experiência prévia consolidada como Analista de Monitoramento, Observabilidade, DevOps ou SysAdmin em nível Pleno.
  • Experiência prática na operação e sustentação de Zabbix e ElasticSearch (ou stack ELK).
  • Experiência com ferramentas modernas como DataDog e Grafana.
  • Conhecimento prático em conceitos e arquitetura de OpenTelemetry.
  • Sólido entendimento dos três pilares da observabilidade: Métricas, Logs e Traces.
  • Habilidade para criar consultas e estruturar dashboards em ferramentas de visualização de dados.
  • Experiência com desenvolvimento de scripts ou automações para resolução de problemas (Python, Shell Script, Go ou similares).
  • Ensino superior completo.
Full job description

Buscamos um(a) Analista de Observabilidade Pleno para protagonizar a evolução da nossa infraestrutura de monitoramento. Em pleno cenário pós-privatização, a Sabesp acelera sua transformação digital para atingir metas globais de eficiência.

Sua missão será nos ajudar a aumentar o nosso nível de maturidade em observabilidade e estabilidade, conectando ferramentas consolidadas (Zabbix e Elastic) a uma arquitetura moderna baseada em DataDog, Grafana e OpenTelemetry. Se você é movido por automação, dados em tempo real e resolução inteligente de problemas complexos em cenários de alta disponibilidade, seu lugar é aqui.


Responsibilities

  • Gerenciar e modernizar a plataforma de observabilidade, atuando tanto na operação das ferramentas (Zabbix e ElasticSearch) quanto na implantação e evolução da stack moderna (DataDog e Grafana).
  • Implementar e distribuir o agente do OpenTelemetry (OTel) em todos os componentes monitoráveis da companhia, abrangendo camadas de Sistemas (APM) e Infraestrutura.
  • Configurar e instrumentar módulos avançados de telemetria, garantindo a correta coleta, correlação e análise de métricas, logs e traces.
  • Criar e customizar dashboards executivos e técnicos, além de estruturar alertas inteligentes para mitigar falsos positivos.
  • Apoiar na definição, revisão e monitoramento de indicadores operacionais e de negócio (SLIs, SLOs e SLAs).
  • Acompanhar eventos de Causa Raiz (RCA) e conduzir agendas de post-mortem junto aos times de tecnologia para propor melhorias contínuas no monitoramento.
  • Desenvolver automações para a solução proativa de problemas e autorremediação de incidentes (self-healing).
  • Acompanhar e apoiar na gestão de contratos com fornecedores e parceiros de soluções de observabilidade.

Requirements

Obrigatórios:

  • Experiência prévia consolidada como Analista de Monitoramento, Observabilidade, DevOps ou SysAdmin em nível Pleno.
  • Experiência prática na operação e sustentação de Zabbix e ElasticSearch (ou stack ELK).
  • Experiência com ferramentas modernas de mercado DataDog e Grafana.
  • Conhecimento prático em conceitos e arquitetura de OpenTelemetry (distribuição de agentes, coletores e instrumentação).
  • Sólido entendimento dos três pilares da observabilidade: Métricas, Logs e Traces.
  • Habilidade para criar consultas e estruturar dashboards em ferramentas de visualização de dados.
  • Experiência com desenvolvimento de scripts ou automações para resolução de problemas (Python, Shell Script, Go ou similares).
  • Ensino superior completo.

Desejáveis:

  • Conhecimento prático em conceitos de SRE (Confiabilidade de Sites) e facilitação de dinâmicas de post-mortem.
  • Familiaridade com ferramentas de Infraestrutura como Código (Terraform ou Ansible) para deploy de agentes.
  • Certificações oficiais em ferramentas de observabilidade (ex: Datadog Fundamentals, Grafana Certified Certified Associate ou equivalentes).
  • Desejável Carteira Nacional de Habilitação - CNH.
Anyscale

Site Reliability Engineer, Platform Infrastructure (Foundations)

📅 Aug 26
Anyscale👥 201 - 500 employees🏢 Computer Software

As a Site Reliability Engineer, you will design and optimize critical infrastructure for distributed AI applications, ensuring high performance and reliability in cloud environments.

KubernetesCloud-native TechnologiesAWSAzure
OpenTable

Site Reliability Engineer II (AI Platform)

🕒 3 days ago
OpenTable👥 1001 - 5000 employees🏢 Hospitality

As a Site Reliability Engineer II, you will design, automate, and manage the core container stack and infrastructure, ensuring reliability and efficiency for global business applications.

LinuxKubernetesCloud-native AutomationContainer Management

Trusted by Remote Workers