Líder de Site Reliability Engineering (SRE)
Talycap Global Bogota, RAP (Especial) Central, Colombia
IT Services and IT Consulting · 51-200 employees
About the role
Lead the global strategy for technological resilience, reliability, and scalability while overseeing the implementation of end-to-end observability. Direct automation initiatives, manage technical debt, and supervise performance testing to ensure the stability of mission-critical business platforms.
What they look for
Requirements
Requires a university degree in Systems, Software, or Electronic Engineering with 5 to 6 years of experience in IT operations or software architecture. Candidates must have at least 2 years of leadership experience in SRE, DevOps, or Performance Engineering.
Full description
🧠 ¡Buscamos Líder de Site Reliability Engineering (SRE)! 🧠
¿Te apasiona transformar operaciones tecnológicas tradicionales en ecosistemas resilientes, automatizados y observables, liderando equipos de alto desempeño que garanticen disponibilidad, rendimiento y continuidad de plataformas críticas de negocio?
🎯 Objetivo del rol:
Serás responsable de liderar la evolución de la operación tecnológica hacia un modelo proactivo basado en principios de Site Reliability Engineering (SRE), observabilidad avanzada y automatización. Tendrás un rol estratégico en la definición de estándares de confiabilidad, resiliencia y rendimiento sobre plataformas empresariales de misión crítica. Además, dirigirás iniciativas de reducción de deuda técnica, adopción de capacidades de autocuración (Self-Healing) y fortalecimiento de la continuidad operativa en entornos híbridos.
🎓 Requisitos del perfil
- Formación académica: Profesional universitario en Ingeniería de Sistemas, Ingeniería de Software, Ingeniería Electrónica o carreras afines de base tecnológica.
- Experiencia: Mínimo 5 a 6 años de experiencia en infraestructura tecnológica, operaciones TI o arquitectura de software, con al menos 2 años liderando equipos de SRE, DevOps o Ingeniería de Rendimiento.
Conocimientos obligatorios:
- ☁️ Cloud: AWS, Azure, ecosistemas híbridos On-Premise y Multi-Cloud
- ⚙️ DevOps y CI/CD: Terraform, Ansible, Infrastructure as Code (IaC), automatización de infraestructura
- 🏛️ Arquitectura: Resiliencia tecnológica, escalabilidad, transición arquitectónica, reducción de deuda técnica, Clean Core
- 🧭 Liderazgo y Metodologías: Site Reliability Engineering (SRE), DevOps, ITIL v4, gestión de SLI/SLO, Blameless Post-Mortems, gestión de incidentes mayores
- 🔗 ERP / SAP: Arquitectura de ecosistemas SAP de misión crítica, S/4HANA, EWM, IBP, BTP, metodologías de despliegue SAP
- 🔧 Otros: Observabilidad end-to-end, telemetría avanzada, monitoreo distribuido, ingeniería de rendimiento, pruebas de carga, pruebas de estrés, Chaos Engineering
Conocimientos deseables:
- 🔧 Otros: Certificación en SRE, certificaciones en herramientas de observabilidad, certificaciones en arquitectura Cloud o metodologías SAP
💡 Competencias personales
- Liderazgo estratégico de equipos multidisciplinarios.
- Pensamiento analítico orientado a la confiabilidad operativa.
- Capacidad de toma de decisiones bajo escenarios críticos.
- Comunicación efectiva con áreas técnicas y de negocio.
- Orientación a la mejora continua y la innovación tecnológica.
⚙️ Responsabilidades principales
- Liderar la estrategia global de resiliencia, confiabilidad y escalabilidad tecnológica.
- Diseñar e implementar capacidades de observabilidad de extremo a extremo sobre plataformas empresariales críticas.
- Definir métricas, indicadores y objetivos de nivel de servicio alineados con el negocio.
- Dirigir iniciativas de automatización y autocuración para reducir la intervención manual en incidentes repetitivos.
- Supervisar pruebas de carga, estrés y simulaciones de fallas para validar la estabilidad de los servicios.
- Liderar análisis de causa raíz bajo enfoques Blameless, promoviendo la mejora continua.
- Gestionar programas de reducción de deuda técnica y fortalecimiento arquitectónico.
- Asegurar la disponibilidad operativa durante procesos de transformación tecnológica y modernización de plataformas.
- Coordinar y desarrollar equipos especializados en SRE, DevOps y rendimiento.
- Presentar riesgos, planes de remediación y estrategias de continuidad operativa a la dirección tecnológica.
🕒 Condiciones laborales
- 📍 Ubicación: Hibrido
- 🧩 Tipo de contrato: Nomina
- ⏰ Horario: Tiempo completo
- 💰 Salario: A convenir
🌐 TALYCAP GLOBAL – Conectamos el mejor talento IT con proyectos de alto impacto.
#LiderSRE #SiteReliabilityEngineering #Observabilidad #TalycapGlobal
Similar roles
-
Summer 2027 Site Reliability Internship
Tradeweb London, England, United Kingdom
-
Digital Site Reliability Engineer
Radisson Hotel Group Madrid, Community of Madrid, Spain
-
Site Reliability Engineer
WorldQuant Montevideo, Montevideo, Uruguay
-
Site Reliability Engineer II
Axon Boston, Massachusetts, United States · $116K–$165K/yr
-
Staff Site Reliability Engineer
Crunchyroll, LLC Los Angeles, California, United States · $210K–$263K/yr
-
Senior Site Reliability Engineer
Ciklum Kyiv, Ukraine