As a Site Reliability Engineer, you'll ensure the availability, scalability, and operational health of AWS-hosted infrastructure while leading incident response and driving a culture of reliability.
Especialista de SRE
📜 Description
- Definição da Infraestrutura dos produtos seguindo as definições da arquitetura;
- Alinhamento e controle dos SLIs, SLAs e SLOs;
- Troubleshooting da infraestrutura da aplicação;
- Auxilia no Troubleshooting da aplicação, sob convite dos desenvolvedores;
- Direciona soluções de monitoração, logs e automação;
- Documentação da Infra dos produtos;
🛠️ Requirements
- Superior Completo;
- Experiência prática no desenvolvimento de soluções técnicas;
- Capacidade de compreender arquiteturas de sistemas;
- Conhecimento de arquitetura distribuída, virtualização e/ou Cloud;
- Conhecimento de sistemas operacionais Linux;
- Experiência na operação de ambientes Cloud – Azure, OCI, AWS e GCP;
- Conhecimento de Docker / containers;
- Conhecimento de Kubernetes;
Full job description
Somos a credsystem. E há mais de 20 anos, criamos oportunidades para você conquistar cada vez mais. Lado a lado com quem faz o varejo acontecer todos os dias, nos tornamos especialistas em seu negócio.
Cultivamos relações e abrimos caminhos para o sucesso. Tudo pra você se aproximar do seu cliente. De um jeito descomplicado, aberto e real.
Estamos inovando sempre para buscar diferentes soluções e oferecer novas possibilidades para o varejo. Com agilidade, tecnologia e renovação, por dentro e por fora.
Quem disse que não dá pra resolver simples pensando grande? Inovar trabalhando com o que a gente já sabe? Crescer no futuro valorizando o presente?
Vem tornar novas conquistas possíveis com a gente!
Responsibilities
E o seu dia a dia como será? 💼
- Definição da Infraestrutura dos produtos seguindo as definições da arquitetura;
- Resiliência do ambiente;
- Alinhamento e controle dos SLIs, SLAs e SLOs;
- Troubleshooting da infraestrutura da aplicação (conhece, participa, propõe soluções);
- Auxilia no Troubleshooting da aplicação, sob convite dos desenvolvedores;
- Direciona soluções de monitoração, logs e automação;
- Documentação da Infra dos produtos;
- Participa e conhece a capacidade e custo da Infraestrutura;
- Análise de tendências das aplicações;
- Direciona novas soluções no produto;
- Participa de POCs e testes de novas soluções;
- IAC: Infraestrutura como código;
- Implantar/Criar infraestrutura em nuvem (Azure, OCI, AWS e GCP)
- Solicitar e acompanhar requisições aos times de infraestrutura onpremises.
Requirements
O que esperamos de você? 🎓
- Superior Completo;
- Experiência prática no desenvolvimento de soluções técnicas, alinhadas às tecnologias específicas da vaga;
- Capacidade de compreender arquiteturas de sistemas e aplicá-las de forma eficiente e estratégica, visando performance, escalabilidade e alinhamento com os objetivos do negócio.
- Conhecimento de arquitetura distribuída, virtualização e/ou Cloud;
- Conhecimento de sistemas operacionais Linux;
- Experiência na operação de ambientes Cloud – Azure, OCI, AWS e GCP
- Conhecimento de Docker / containers;
- Conhecimento de Kubernetes
⭐ Antes de qualquer coisa saiba que você irá se destacar super bem no nosso time, se:⭐
- Conhecimento de mensageria: Kafka e outros
- Conhecimento dos conceitos da cultura Devops;
- Conhecimento em CI/CD (Azure Devops, ArgoCD e outros);
- Conhecimentos em automação de processos utilizando ferramentas de automação de mercado: Ansible / Terraform;
- Conhecimento em Shell Script para auxiliar a automação e construção de soluções;
- Conhecimento em Prometheus e Grafana para monitoramento e análise de métricas;
- Experiência com modelos de observabilidade voltados para o negócio, com foco em indicadores estratégicos e operacionais.
Similar jobs
Search more Site Reliability Engineer jobsAs a Site Reliability Engineer II, you will design, automate, and manage the core container stack and infrastructure, ensuring reliability and efficiency for global business applications.
As a Systems Engineer (SRE), you will design, implement, and maintain CI/CD pipelines, manage cloud resources, and automate infrastructure to enhance system performance and reliability.
Site Reliability Engineer, Platform Infrastructure (Foundations)
As a Site Reliability Engineer, you will design and optimize critical infrastructure for distributed AI applications, ensuring high performance and reliability in cloud environments.
Site Reliability Engineer (SRE)
As a Site Reliability Engineer (SRE), you will enhance infrastructure reliability, automate processes, and develop scalable production systems to support our social discovery platforms.
