CU

Senior Site Reliability Engineer (SRE) Azure - AWS

Confidencial USQ
Posted 2 hours ago
ColombiaRemoteEngineering & Development
Is this job info correct?

🎯 Buscamos un perfil senior, con experiencia demostrable liderando iniciativas de confiabilidad, monitoreo e incidentes. El foco estará principalmente en estructurar, operar, madurar y evolucionar el sistema de observabilidad, más que en desarrollo de software.


📍 Ubicación: Medellín, Colombia

💻 Modalidad: Remoto

📄 Contrato: Indefinido

💰 Salario: A convenir

⏰ Disponibilidad para trabajar alineado con horario PST.


🎯 Tu reto

Fortalecer y evolucionar el sistema de monitoreo y observabilidad, prevenir incidentes y establecer indicadores que permitan mejorar continuamente la confiabilidad de los servicios.


🛠️ Requisitos

• Experiencia senior en SRE, Observability, Cloud Operations, Production Engineering o roles similares.

Experiencia comprobable implementando y madurando sistemas de monitoreo.

• Experiencia en gestión integral de alertas e incidentes, RCA y mejora continua.

• Experiencia liderando equipos técnicos u operativos.

• Azure Cloud como experiencia principal. AWS es deseable.

• Kubernetes / AKS, Grafana, Prometheus, Elasticsearch y Azure Monitor.

• APM y plataformas de gestión de incidentes como OpsGenie.

• Python, Bash y/o PowerShell para automatización.

  • Inglés: Avanzado B2 – C2


🔧 Principales funciones

• Liderar la implementación, organización y maduración del sistema de monitoreo y observabilidad.

• Gestionar métricas, logs, trazas, alertas, dashboards y APM.

• Definir y hacer seguimiento a SLIs, SLOs y Error Budgets.

• Liderar la gestión de incidentes críticos, escalamiento, resolución y análisis de causa raíz (RCA).

• Identificar incidentes recurrentes y establecer acciones preventivas y correctivas.

• Diseñar y mejorar SOPs, runbooks, procesos e indicadores de confiabilidad.

• Optimizar el sistema de alertas y sus rutas de escalamiento.

• Liderar equipos responsables de la gestión y atención de incidentes.

• Elaborar y presentar reportes de disponibilidad, incidentes, confiabilidad y avances.

• Participar en iniciativas de planificación de capacidad y optimización del rendimiento.

• Trabajar transversalmente con equipos de Ingeniería, Desarrollo y Operaciones.


🎁 Beneficios

✔️ Póliza de salud prepagada

✔️ Bono de conectividad y seguro de vida

✔️ Capacitación y certificaciones en Azure

✔️ Acceso a O’Reilly, Platzi y Codely

✔️ Vacaciones y horarios flexibles

✔️ Días libres adicionales por cumpleaños

✔️ Trabajo remoto

✔️ Posibilidad de traslado a Canadá


📩 Si cuentas con la experiencia y estás listo(a) para asumir un reto internacional en SRE y Cloud Reliability, postúlate o comparte esta oportunidad.


consultor1@headhuntertsi.com

Similar jobs