Remote Jobs RockRemote Jobs Rock

ESPECIALISTA INFRAESTRUTURA SRE

🕒 20 days ago
SRE PracticesObservabilityAutomationInfrastructure Engineering

📜 Description

  • Act as a technical reference in investigating and resolving critical incidents, conducting root cause analyses.
  • Monitor and evolve reliability, availability, and performance indicators using SLIs, SLOs, and Error Budgets.
  • Develop and improve observability strategies, ensuring adequate monitoring through metrics, logs, traces, dashboards, and alerts.
  • Support, troubleshoot, and evolve cloud and Kubernetes infrastructure environments focusing on availability and performance.
  • Identify risks, bottlenecks, and improvement opportunities in architecture and capacity, supporting high availability and disaster recovery initiatives.
  • Automate operational activities and recurring procedures to reduce manual effort and increase operational efficiency.

🛠️ Requirements

  • Bachelor's degree or ongoing studies in Information Technology, Computer Science, Information Systems, or related fields.
  • Solid experience in Linux environments.
  • Practical experience with Google Cloud Platform (GCP).
  • Experience managing Kubernetes environments.
  • Experience in troubleshooting mission-critical environments.
  • Advanced knowledge in networks, DNS, load balancing, and infrastructure.
  • Experience in observability and monitoring.
  • Experience with incident management and root cause analysis.
Full job description

A Funcional Health Tech é movida pela certeza de que a Saúde é o pilar principal da vida das pessoas, por isso quebramos barreiras para promovê-la de forma sustentável.

Para realizar nosso propósito, inovamos todos os dias unindo pessoas, tecnologia e dados para prover o ecossistema da saúde com soluções que geram eficiência e sustentabilidade em toda a cadeia.

Aqui, você irá participar, de maneira direta ou indireta, da criação de novas soluções para os mais diversos serviços de saúde porque essa é a missão diária de todos nós na Funcional. Pesquisamos, criamos e fazemos acontecer, porque está em nosso DNA.


Responsibilities

Sua missão como Pessoa Analista Infra Sênior, será:


Atuar na sustentação e evolução da confiabilidade, disponibilidade e resiliência dos ambientes e aplicações, utilizando práticas de SRE, observabilidade, automação e engenharia de infraestrutura para prevenir falhas, reduzir impactos operacionais e melhorar continuamente a estabilidade dos serviços.


  • Atuar como referência técnica na investigação e resolução de incidentes críticos, conduzindo análises de causa raiz e apoiando a definição de ações preventivas e corretivas.
  • Monitorar e evoluir indicadores de confiabilidade, disponibilidade e desempenho dos serviços, utilizando práticas como SLIs, SLOs e Error Budgets.
  • Desenvolver e aprimorar estratégias de observabilidade, garantindo monitoramento adequado por meio de métricas, logs, traces, dashboards e alertas eficientes.
  • Atuar na sustentação, troubleshooting e evolução de ambientes de infraestrutura, cloud e Kubernetes, com foco em disponibilidade, performance e resiliência.
  • Identificar riscos, gargalos e oportunidades de melhoria na arquitetura e capacidade dos ambientes, apoiando iniciativas de alta disponibilidade, Disaster Recovery e continuidade dos serviços.
  • Automatizar atividades operacionais, diagnósticos e procedimentos recorrentes, reduzindo esforço manual e aumentando a eficiência e previsibilidade das operações.
  • Participar de revisões técnicas, postmortems e iniciativas de melhoria contínua, disseminando boas práticas de SRE e contribuindo para a evolução da maturidade operacional dos times.

Requirements

Para isso, esperamos que você possua:


  • Formação completa ou em andamento em Tecnologia da Informação, Ciência da Computação, Sistemas de Informação ou áreas correlatas.
  • Experiência sólida em ambientes Linux.
  • Experiência prática com Google Cloud Platform (GCP).
  • Experiência administrando ambientes Kubernetes.
  • Experiência em troubleshooting de ambientes de missão crítica.
  • Conhecimento avançado em redes, DNS, balanceamento de carga e infraestrutura.
  • Experiência em observabilidade e monitoramento.
  • Experiência com gestão de incidentes e análise de causa raiz.
  • Experiência com automação operacional utilizando Python, Shell Script ou PowerShell.
  • Experiência na implantação de práticas de SRE.
Okta

Senior Site Reliability Engineer

🕒 11 days ago
Okta👥 10,000+ employees🏢 Software Development

As a Senior Site Reliability Engineer, you will build and operate a Kubernetes-based platform, enhancing internal workflows and ensuring reliability for AI-driven processes.

KubernetesSite Reliability EngineeringPlatform EngineeringInfrastructure Engineering
Crunchyroll

Senior Site Reliability Engineer

🕒 22 days ago
Crunchyroll👥 1001 - 5000 employees🏢 Entertainment

As a Senior Site Reliability Engineer, you will enhance the reliability, scalability, and security of Crunchyroll's data platforms while driving modern SRE practices and cross-functional collaboration.

Site Reliability EngineeringKubernetesGoogle Cloud PlatformInfrastructure As Code
Crunchyroll

Staff Site Reliability Engineer

🕒 20 days ago
Crunchyroll👥 1001 - 5000 employees🏢 Entertainment

The Staff Site Reliability Engineer will enhance the reliability, scalability, performance, and security of Crunchyroll's data platforms while driving SRE practices and collaborating across teams.

Site Reliability EngineeringPlatform EngineeringInfrastructure EngineeringKubernetes

Trusted by Remote Workers