Remote Jobs RockRemote Jobs Rock

Site Reliability Engineer (SRE) – Service Operations AR

📅 Jun 17
LinuxUNIXApacheNginx

📜 Description

  • Monitor and ensure the availability, stability, and performance of client solutions.
  • Investigate and resolve technical incidents, troubleshooting applications and infrastructure.
  • Analyze metrics and logs to proactively detect anomalies and potential incidents.
  • Participate in critical incident analysis, identifying root causes and preventive actions.
  • Collaborate with Development, Delivery, and Operations teams to enhance solution operability.

🛠️ Requirements

  • Solid knowledge of Linux/UNIX operating systems.
  • Experience with web servers like Apache and Nginx.
  • Familiarity with application servers such as Tomcat and JBoss.
  • Proficiency in scripting and automation languages like Bash and Python.
  • Experience with monitoring and observability tools.
Full job description
Sobre Veritran
Somos una compañía global de tecnología abocada a simplificar las experiencias bancarias.
A través de nuestras soluciones de negocio inspiramos a las instituciones financieras a llevar su digitalización al siguiente nivel.
Estamos orgullosos de ser un partner estratégico clave para reconocidos clientes en América Latina, Norteamérica y Europa, impulsándolos a convertirse en los bancos que sus clientes prefieren.
Creamos productos innovadores y centrados en el cliente que permiten que más de 50 millones de personas autogestionen sus finanzas.

Lo que buscamos en ti
Nos encontramos en la búsqueda de un profesional apasionado por la tecnología, metódico, proactivo y con fuerte orientación a la resolución de problemas, que quiera asumir el desafío de contribuir a la confiabilidad, disponibilidad y performance de soluciones de misión crítica utilizadas por nuestros clientes.
Buscamos una persona con capacidad para analizar problemas técnicos de manera integral, anticiparse a potenciales incidentes y trabajar en conjunto con diferentes equipos para mejorar continuamente la estabilidad y operabilidad de nuestras soluciones.

Para esta posición, esperamos que cuentes con sólidos conocimientos y experiencia en:

- Sistemas Operativos Linux/UNIX.
- Web Servers como Apache, Nginx o similares.
- Application Servers como Tomcat, WebLogic, JBoss o similares.
- Diagnóstico y troubleshooting de aplicaciones e infraestructura.
- Herramientas de monitoreo, observabilidad y alertamiento.
- Lenguajes de scripting y automatización como Bash, Python o similares.
- Contenedores y tecnologías como Docker.
- Soporte técnico a clientes y resolución de incidentes en ambientes - productivos.
- Será valorado que cuentes además con conocimientos en:
- Infraestructura: servidores, redes, storage, virtualización y backups.
- Bases de datos como Oracle y PostgreSQL.
Plataformas Cloud.
- Conceptos de alta disponibilidad, resiliencia, performance y capacity management.
- Gestión de incidentes, análisis de causa raíz y procesos de mejora continua.
- Tecnologías de orquestación de contenedores como Kubernetes.
- Infraestructura como código (IaC) y herramientas como Terraform o similares.
- Prácticas de CI/CD y automatización de despliegues.
- Definición y seguimiento de SLIs, SLOs y SLAs, incluyendo conceptos como error budgets.
- Prácticas de Site Reliability Engineering, automatización de tareas operativas y reducción de toil.
- Experiencia utilizando herramientas modernas de observabilidad para métricas, logs y trazas distribuidas.
- Conocimientos de programación que permitan desarrollar automatizaciones y herramientas orientadas a mejorar la confiabilidad y eficiencia operativa.

Es importante que cuentes con muy buenas habilidades de comunicación y capacidad para trabajar en escenarios de alta criticidad, establecer prioridades y resolver múltiples situaciones en simultáneo.
Buscamos también que puedas generar confianza en nuestros clientes y trabajar de manera colaborativa con equipos de Desarrollo, Delivery, Plataforma y Operaciones.

Algunos de tus desafíos del día a día serán
- Monitorear y contribuir a garantizar la disponibilidad, estabilidad y performance de las soluciones implementadas en nuestros clientes.
- Investigar y resolver incidentes técnicos, realizando troubleshooting sobre aplicaciones, infraestructura, integraciones y bases de datos.
- Analizar métricas, logs y eventos para detectar comportamientos anómalos de manera proactiva, anticipando potenciales incidentes antes de que afecten al servicio.
- Realizar el seguimiento end-to-end de incidentes y problemas hasta asegurar su resolución definitiva.
- Participar en el análisis de incidentes críticos, identificando causas raíz y acciones preventivas que permitan evitar su recurrencia.
Trabajar en la definición y mejora de mecanismos de monitoreo, observabilidad, alertamiento y healthchecks de las soluciones.
- Identificar oportunidades de automatización que permitan reducir tareas manuales, errores operativos y tiempos de recuperación.
- Colaborar con los equipos de Desarrollo, Plataforma, Delivery y Operaciones para mejorar la operabilidad y confiabilidad de las soluciones desde su diseño hasta producción.
- Acompañar a nuestros clientes durante situaciones de incidentes, brindando asistencia técnica clara, oportuna y orientada a la resolución.
- Incorporar de manera proactiva el feedback y las necesidades detectadas en nuestros clientes, transformándolas en oportunidades de mejora para nuestros productos, procesos y servicios.
- Contribuir a la documentación de procedimientos operativos, troubleshooting guides y conocimiento técnico que permita mejorar continuamente la capacidad de respuesta del equipo.

Te incorporarás a un equipo responsable de asegurar la confiabilidad y continuidad operativa de soluciones críticas, trabajando de manera transversal junto a diferentes áreas de Veritran y nuestros clientes.
Nuestro objetivo es evolucionar desde un modelo principalmente reactivo hacia una operación cada vez más proactiva, observable y automatizada, donde los problemas puedan detectarse anticipadamente, los incidentes se resuelvan rápidamente y cada evento contribuya a mejorar la resiliencia de nuestras soluciones.
Compartirás con el equipo la responsabilidad de asegurar que nuestros servicios mantengan altos estándares de disponibilidad, performance, seguridad y calidad operativa durante todo su ciclo de vida.

Te proponemos
Oportunidades de desarrollo en una compañía que crece y se transforma con agilidad, año tras año, en un contexto global y desafiante.
Un excelente clima de trabajo, que cuida tu salud y bienestar para que vivas una experiencia única y diferente.
Una cultura de trabajo colaborativa, con comunicaciones abiertas que promueven la libertad, la responsabilidad, la solidaridad y la humildad como nuestros valores fundamentales.
¿Estás listo para asumir el desafío? Únete a nuestro equipo
SpaceX

Site Reliability Engineer (Manufacturing Infrastructure)

🕒 17 days ago
SpaceX👥 10,000+ employees🏢 Aviation And Aerospace Component Manufacturing🤝 B2B

As a Site Reliability Engineer for Manufacturing Infrastructure, you will enhance the reliability and scalability of systems supporting SpaceX's manufacturing processes.

Site Reliability EngineeringDevOpsInfrastructure As CodeLinux
Pagerduty

Site Reliability Engineer II

🕒 19 days ago
Pagerduty👥 1001 - 5000 employees🏢 Computer Software

As a Site Reliability Engineer II, you will enhance and maintain the foundational infrastructure that supports PagerDuty's real-time digital operations platform, ensuring reliability and scalability.

Site Reliability EngineeringDevOpsPlatform EngineeringLinux
Anyscale

Site Reliability Engineer, Platform Infrastructure (Foundations)

🕒 25 days ago
Anyscale👥 201 - 500 employees🏢 Computer Software

As a Site Reliability Engineer, you will design and optimize critical infrastructure for distributed AI applications, ensuring high performance and reliability in cloud environments.

KubernetesCloud-native TechnologiesAWSAzure

Trusted by Remote Workers