Talycap Global

Líder de Site Reliability Engineering (SRE)

Talycap Global Bogota, RAP (Especial) Central, Colombia

IT Services and IT Consulting · 51-200 employees

6 h ago
sre Senior (5-10 yrs) Full-time Colombia
Create a free account to apply — email only, no card. You can also save this posting or score it against your profile with AI.

About the role

Lead the global strategy for technological resilience, reliability, and scalability while overseeing the implementation of end-to-end observability. Direct automation initiatives, manage technical debt, and supervise performance testing to ensure the stability of mission-critical business platforms.

What they look for

Site Reliability Engineering DevOps AWS Azure Terraform Ansible Infrastructure as Code Observability SAP S/4HANA Chaos Engineering Performance Engineering ITIL v4 Scalability Resilience Technical Leadership Incident Management

Requirements

Requires a university degree in Systems, Software, or Electronic Engineering with 5 to 6 years of experience in IT operations or software architecture. Candidates must have at least 2 years of leadership experience in SRE, DevOps, or Performance Engineering.

Full description

🧠 ¡Buscamos Líder de Site Reliability Engineering (SRE)! 🧠

¿Te apasiona transformar operaciones tecnológicas tradicionales en ecosistemas resilientes, automatizados y observables, liderando equipos de alto desempeño que garanticen disponibilidad, rendimiento y continuidad de plataformas críticas de negocio?

🎯 Objetivo del rol:

Serás responsable de liderar la evolución de la operación tecnológica hacia un modelo proactivo basado en principios de Site Reliability Engineering (SRE), observabilidad avanzada y automatización. Tendrás un rol estratégico en la definición de estándares de confiabilidad, resiliencia y rendimiento sobre plataformas empresariales de misión crítica. Además, dirigirás iniciativas de reducción de deuda técnica, adopción de capacidades de autocuración (Self-Healing) y fortalecimiento de la continuidad operativa en entornos híbridos.

🎓 Requisitos del perfil

  • Formación académica: Profesional universitario en Ingeniería de Sistemas, Ingeniería de Software, Ingeniería Electrónica o carreras afines de base tecnológica.
  • Experiencia: Mínimo 5 a 6 años de experiencia en infraestructura tecnológica, operaciones TI o arquitectura de software, con al menos 2 años liderando equipos de SRE, DevOps o Ingeniería de Rendimiento.

Conocimientos obligatorios:

  • ☁️ Cloud: AWS, Azure, ecosistemas híbridos On-Premise y Multi-Cloud
  • ⚙️ DevOps y CI/CD: Terraform, Ansible, Infrastructure as Code (IaC), automatización de infraestructura
  • 🏛️ Arquitectura: Resiliencia tecnológica, escalabilidad, transición arquitectónica, reducción de deuda técnica, Clean Core
  • 🧭 Liderazgo y Metodologías: Site Reliability Engineering (SRE), DevOps, ITIL v4, gestión de SLI/SLO, Blameless Post-Mortems, gestión de incidentes mayores
  • 🔗 ERP / SAP: Arquitectura de ecosistemas SAP de misión crítica, S/4HANA, EWM, IBP, BTP, metodologías de despliegue SAP
  • 🔧 Otros: Observabilidad end-to-end, telemetría avanzada, monitoreo distribuido, ingeniería de rendimiento, pruebas de carga, pruebas de estrés, Chaos Engineering

Conocimientos deseables:

  • 🔧 Otros: Certificación en SRE, certificaciones en herramientas de observabilidad, certificaciones en arquitectura Cloud o metodologías SAP

💡 Competencias personales

  • Liderazgo estratégico de equipos multidisciplinarios.
  • Pensamiento analítico orientado a la confiabilidad operativa.
  • Capacidad de toma de decisiones bajo escenarios críticos.
  • Comunicación efectiva con áreas técnicas y de negocio.
  • Orientación a la mejora continua y la innovación tecnológica.

⚙️ Responsabilidades principales

  • Liderar la estrategia global de resiliencia, confiabilidad y escalabilidad tecnológica.
  • Diseñar e implementar capacidades de observabilidad de extremo a extremo sobre plataformas empresariales críticas.
  • Definir métricas, indicadores y objetivos de nivel de servicio alineados con el negocio.
  • Dirigir iniciativas de automatización y autocuración para reducir la intervención manual en incidentes repetitivos.
  • Supervisar pruebas de carga, estrés y simulaciones de fallas para validar la estabilidad de los servicios.
  • Liderar análisis de causa raíz bajo enfoques Blameless, promoviendo la mejora continua.
  • Gestionar programas de reducción de deuda técnica y fortalecimiento arquitectónico.
  • Asegurar la disponibilidad operativa durante procesos de transformación tecnológica y modernización de plataformas.
  • Coordinar y desarrollar equipos especializados en SRE, DevOps y rendimiento.
  • Presentar riesgos, planes de remediación y estrategias de continuidad operativa a la dirección tecnológica.

🕒 Condiciones laborales

  • 📍 Ubicación: Hibrido
  • 🧩 Tipo de contrato: Nomina
  • ⏰ Horario: Tiempo completo
  • 💰 Salario: A convenir

🌐 TALYCAP GLOBAL – Conectamos el mejor talento IT con proyectos de alto impacto.

#LiderSRE #SiteReliabilityEngineering #Observabilidad #TalycapGlobal

Similar roles