Remote Jobs RockRemote Jobs Rock

Especialista Devops

📅 Aug 25
Site Reliability EngineeringDatadogELK StackPython

📜 Description

  • Act as a key technical reference in observability, evolving monitoring strategies and operational automation.
  • Design, implement, and enhance observability strategies using Datadog and ELK Stack.
  • Structure and correlate metrics, logs, and traces for troubleshooting and root cause analysis.
  • Define and evolve SLIs, SLOs, Error Budgets, dashboards, and intelligent alerts to reduce noise and accelerate incident resolution.
  • Support development squads in adopting best practices in SRE, DevOps, observability, and reliability.
  • Automate operational activities and processes using Python.

🛠️ Requirements

  • Experiência sólida em Site Reliability Engineering (SRE) ou áreas correlatas;
  • Forte experiência com Datadog;
  • Experiência em análise de logs utilizando ELK Stack (Elasticsearch e Kibana);
  • Vivência com correlação entre métricas, logs e traces para identificação de causa raiz;
  • Experiência em ambientes de missão crítica, alta disponibilidade e alto volume transacional;
  • Conhecimento de práticas de observabilidade e monitoramento de aplicações.
  • Cloud Computing, preferencialmente AWS;
  • Pipelines de CI/CD;
  • Infraestrutura como Código (Terraform);
  • Automação utilizando Python;
Full job description

No Grupo Stefanini, acreditamos no poder da colaboração. Co-criamos soluções inovadoras em parceria com nossos clientes, combinando tecnologia de ponta, inteligência artificial e a criatividade humana. Estamos na vanguarda da resolução de problemas de negócios, proporcionando impacto real em escala global.


Ao se juntar à Stefanini, você se torna parte de uma jornada global de transformação. Estamos empenhados em criar impacto positivo não apenas nos negócios, mas também na vida de nossos colaboradores. Se você procura uma oportunidade de crescimento profissional em uma empresa que valoriza inovação, respeito, autonomia e parceria, você encontra aqui!

Junte-se a nós e seja parte da mudança!



#LIREMOTE

#LI-SS1

Responsibilities

Estamos em busca de uma Pessoa Engenheira SRE com foco em Observabilidade para atuar em ambientes críticos, garantindo alta disponibilidade, performance e confiabilidade de aplicações de missão crítica.

Você será uma das principais referências técnicas em observabilidade, trabalhando na evolução da estratégia de monitoramento, análise de incidentes e automação operacional, além de apoiar os times de engenharia na construção de uma cultura de excelência operacional e confiabilidade.


Principais responsabilidades

  • Projetar, implementar e evoluir a estratégia de observabilidade utilizando Datadog e ELK Stack (Elasticsearch + Kibana);
  • Estruturar e correlacionar métricas, logs e traces para troubleshooting e análise de causa raiz;
  • Definir e evoluir SLIs, SLOs, Error Budgets, dashboards e alertas inteligentes, reduzindo ruídos e acelerando a resolução de incidentes;
  • Atuar tecnicamente em incidentes críticos, conduzindo análises de causa raiz e propondo ações preventivas para evitar recorrências;
  • Apoiar squads de desenvolvimento na adoção das melhores práticas de SRE, DevOps, observabilidade e confiabilidade;
  • Automatizar atividades operacionais e processos utilizando Python;
  • Contribuir para a evolução contínua da plataforma, promovendo maior estabilidade, escalabilidade e eficiência operacional.


Requirements

equisitos obrigatórios

  • Experiência sólida em Site Reliability Engineering (SRE) ou áreas correlatas;
  • Forte experiência com Datadog;
  • Experiência em análise de logs utilizando ELK Stack (Elasticsearch e Kibana);
  • Vivência com correlação entre métricas, logs e traces para identificação de causa raiz;
  • Experiência em ambientes de missão crítica, alta disponibilidade e alto volume transacional;
  • Conhecimento de práticas de observabilidade e monitoramento de aplicações.

Conhecimentos desejáveis

  • Cloud Computing, preferencialmente AWS;
  • Kubernetes;
  • Pipelines de CI/CD;
  • Infraestrutura como Código (Terraform);
  • Automação utilizando Python;
  • Conhecimento de aplicações Java em runtime e troubleshooting.

Será considerado um diferencial

  • Experiência com definição de SLIs, SLOs, Error Budgets e cultura SRE;
  • Experiência em ambientes Multi-Cloud;
  • Automação avançada de operações;
  • Conhecimento em Inteligência Artificial aplicada à observabilidade e operações (AIOps).


Trusted by Remote Workers