As a Senior Site Reliability Engineer, you will build and operate a Kubernetes-based platform, enhancing internal workflows and ensuring reliability for AI-driven processes.
ESPECIALISTA INFRAESTRUTURA SRE
📜 Description
- Act as a technical reference in investigating and resolving critical incidents, conducting root cause analyses.
- Monitor and evolve reliability, availability, and performance indicators using SLIs, SLOs, and Error Budgets.
- Develop and improve observability strategies, ensuring adequate monitoring through metrics, logs, traces, dashboards, and alerts.
- Support, troubleshoot, and evolve cloud and Kubernetes infrastructure environments focusing on availability and performance.
- Identify risks, bottlenecks, and improvement opportunities in architecture and capacity, supporting high availability and disaster recovery initiatives.
- Automate operational activities and recurring procedures to reduce manual effort and increase operational efficiency.
🛠️ Requirements
- Bachelor's degree or ongoing studies in Information Technology, Computer Science, Information Systems, or related fields.
- Solid experience in Linux environments.
- Practical experience with Google Cloud Platform (GCP).
- Experience managing Kubernetes environments.
- Experience in troubleshooting mission-critical environments.
- Advanced knowledge in networks, DNS, load balancing, and infrastructure.
- Experience in observability and monitoring.
- Experience with incident management and root cause analysis.
Full job description
A Funcional Health Tech é movida pela certeza de que a Saúde é o pilar principal da vida das pessoas, por isso quebramos barreiras para promovê-la de forma sustentável.
Para realizar nosso propósito, inovamos todos os dias unindo pessoas, tecnologia e dados para prover o ecossistema da saúde com soluções que geram eficiência e sustentabilidade em toda a cadeia.
Aqui, você irá participar, de maneira direta ou indireta, da criação de novas soluções para os mais diversos serviços de saúde porque essa é a missão diária de todos nós na Funcional. Pesquisamos, criamos e fazemos acontecer, porque está em nosso DNA.
Responsibilities
Sua missão como Pessoa Analista Infra Sênior, será:
Atuar na sustentação e evolução da confiabilidade, disponibilidade e resiliência dos ambientes e aplicações, utilizando práticas de SRE, observabilidade, automação e engenharia de infraestrutura para prevenir falhas, reduzir impactos operacionais e melhorar continuamente a estabilidade dos serviços.
- Atuar como referência técnica na investigação e resolução de incidentes críticos, conduzindo análises de causa raiz e apoiando a definição de ações preventivas e corretivas.
- Monitorar e evoluir indicadores de confiabilidade, disponibilidade e desempenho dos serviços, utilizando práticas como SLIs, SLOs e Error Budgets.
- Desenvolver e aprimorar estratégias de observabilidade, garantindo monitoramento adequado por meio de métricas, logs, traces, dashboards e alertas eficientes.
- Atuar na sustentação, troubleshooting e evolução de ambientes de infraestrutura, cloud e Kubernetes, com foco em disponibilidade, performance e resiliência.
- Identificar riscos, gargalos e oportunidades de melhoria na arquitetura e capacidade dos ambientes, apoiando iniciativas de alta disponibilidade, Disaster Recovery e continuidade dos serviços.
- Automatizar atividades operacionais, diagnósticos e procedimentos recorrentes, reduzindo esforço manual e aumentando a eficiência e previsibilidade das operações.
- Participar de revisões técnicas, postmortems e iniciativas de melhoria contínua, disseminando boas práticas de SRE e contribuindo para a evolução da maturidade operacional dos times.
Requirements
Para isso, esperamos que você possua:
- Formação completa ou em andamento em Tecnologia da Informação, Ciência da Computação, Sistemas de Informação ou áreas correlatas.
- Experiência sólida em ambientes Linux.
- Experiência prática com Google Cloud Platform (GCP).
- Experiência administrando ambientes Kubernetes.
- Experiência em troubleshooting de ambientes de missão crítica.
- Conhecimento avançado em redes, DNS, balanceamento de carga e infraestrutura.
- Experiência em observabilidade e monitoramento.
- Experiência com gestão de incidentes e análise de causa raiz.
- Experiência com automação operacional utilizando Python, Shell Script ou PowerShell.
- Experiência na implantação de práticas de SRE.
Similar jobs
Search more Site Reliability Engineer jobsSenior Staff Site Reliability Engineer- Golang
As a Senior Staff Site Reliability Engineer, you will ensure the reliability and operational integrity of a global infrastructure, developing automation and fault-tolerant systems.
As a Senior Site Reliability Engineer, you will enhance the reliability, scalability, and security of Crunchyroll's data platforms while driving modern SRE practices and cross-functional collaboration.
As a Senior Site Reliability Engineer, you will lead initiatives to enhance reliability and operational excellence across GoDaddy's Commerce platform, collaborating with various engineering teams.
The Staff Site Reliability Engineer will enhance the reliability, scalability, performance, and security of Crunchyroll's data platforms while driving SRE practices and collaborating across teams.
