Site Reliability Engineer (SRE)
Imprescindible:Kubernetes
MISIÓN DEL PUESTO
Asegurar la confiabilidad, disponibilidad y desempeño de los servicios productivos mediante el monitoreo continuo, la automatización de procesos operativos y la gestión eficiente de incidentes, para contribuir a la mejora continua de la plataforma tecnológica y a la estabilidad del servicio
ACTIVIDADES
- Monitorear la disponibilidad, desempeño y estabilidad de los servicios en producción para garantizar su operación continua
- Implementar y administrar herramientas de monitoreo y observabilidad para asegurar la visibilidad de los servicios
- Definir y dar seguimiento a SLIs, SLOs y SLAs para medir y garantizar los niveles de servicio
- Configurar y optimizar alertas mediante criterios de monitoreo para detectar incidentes de forma oportuna
- Atender y coordinar la resolución de incidentes en ambientes productivos mediante actividades de diagnóstico, escalación y seguimiento para restablecer la continuidad de los servicios
- Analizar métricas, registros y trazas de operación mediante herramientas de monitoreo para identificar fallas, degradaciones y anomalías en los servicios
- Realizar análisis de causa raíz y documentar incidentes a través de metodologías de post-mortem para prevenir su recurrencia y fortalecer la confiabilidad operativa
- Implementar automatizaciones de tareas operativas y procesos de recuperación mediante scripts y procedimientos estandarizados para optimizar la gestión de los servicios
- Ejecutar pruebas de resiliencia, carga y estrés mediante escenarios controlados para validar la estabilidad y disponibilidad de los servicios
- Monitorear y administrar la capacidad de la infraestructura (CPU, memoria, red, almacenamiento) mediante el seguimiento de recursos de procesamiento, memoria, red y almacenamiento para garantizar un desempeño adecuado de la operación
- Identificar cuellos de botella mediante el análisis del comportamiento de los sistemas para proponer mejoras de rendimiento y confiabilidad
REQUISITOS
- Licenciatura/ Ingeniería en Sistemas, Tecnologías de la Información, Computación o a fin
- Experiencia de 1 año en operación de sistemas productivos
- Manejo de Ambientes críticos (alta disponibilidad)
- Manejo de incidentes y soporte avanzado
- Experiencia en Streaming o servicios de alto tráfico (Deseable)
- Conocimiento en Monitoreo y observabilidad (avanzado)
- Manejo de Sistemas Linux: diagnóstico de performance y fallas
- Redes: conectividad, latencia, balanceo de carga
- Automatización: scripting
- Ingles Tecnico Avanzado.
- Requerimientos- Educación mínima: Educación superior
- Licenciatura 1 año de experiencia
- Idiomas: Inglés
- Edad: entre 25 y 25 años
- Conocimientos: Automatización, Backend, Desarrollo front end, Kubernetes, Automatización de procesos, Lenguajes de programación científica
- Palabras clave: ingeniero, engineers, ingeniera, ing, engineer