Senior Site Reliability Engineer (SRE) Azure - AWS
Confidencial USQ🎯 Buscamos un perfil senior, con experiencia demostrable liderando iniciativas de confiabilidad, monitoreo e incidentes. El foco estará principalmente en estructurar, operar, madurar y evolucionar el sistema de observabilidad, más que en desarrollo de software.
📍 Ubicación: Medellín, Colombia
💻 Modalidad: Remoto
📄 Contrato: Indefinido
💰 Salario: A convenir
⏰ Disponibilidad para trabajar alineado con horario PST.
🎯 Tu reto
Fortalecer y evolucionar el sistema de monitoreo y observabilidad, prevenir incidentes y establecer indicadores que permitan mejorar continuamente la confiabilidad de los servicios.
🛠️ Requisitos
• Experiencia senior en SRE, Observability, Cloud Operations, Production Engineering o roles similares.
• Experiencia comprobable implementando y madurando sistemas de monitoreo.
• Experiencia en gestión integral de alertas e incidentes, RCA y mejora continua.
• Experiencia liderando equipos técnicos u operativos.
• Azure Cloud como experiencia principal. AWS es deseable.
• Kubernetes / AKS, Grafana, Prometheus, Elasticsearch y Azure Monitor.
• APM y plataformas de gestión de incidentes como OpsGenie.
• Python, Bash y/o PowerShell para automatización.
- Inglés: Avanzado B2 – C2
🔧 Principales funciones
• Liderar la implementación, organización y maduración del sistema de monitoreo y observabilidad.
• Gestionar métricas, logs, trazas, alertas, dashboards y APM.
• Definir y hacer seguimiento a SLIs, SLOs y Error Budgets.
• Liderar la gestión de incidentes críticos, escalamiento, resolución y análisis de causa raíz (RCA).
• Identificar incidentes recurrentes y establecer acciones preventivas y correctivas.
• Diseñar y mejorar SOPs, runbooks, procesos e indicadores de confiabilidad.
• Optimizar el sistema de alertas y sus rutas de escalamiento.
• Liderar equipos responsables de la gestión y atención de incidentes.
• Elaborar y presentar reportes de disponibilidad, incidentes, confiabilidad y avances.
• Participar en iniciativas de planificación de capacidad y optimización del rendimiento.
• Trabajar transversalmente con equipos de Ingeniería, Desarrollo y Operaciones.
🎁 Beneficios
✔️ Póliza de salud prepagada
✔️ Bono de conectividad y seguro de vida
✔️ Capacitación y certificaciones en Azure
✔️ Acceso a O’Reilly, Platzi y Codely
✔️ Vacaciones y horarios flexibles
✔️ Días libres adicionales por cumpleaños
✔️ Trabajo remoto
✔️ Posibilidad de traslado a Canadá
📩 Si cuentas con la experiencia y estás listo(a) para asumir un reto internacional en SRE y Cloud Reliability, postúlate o comparte esta oportunidad.
consultor1@headhuntertsi.com