Especialista de Observabilidad & SRE
Talycap Global Bogota, RAP (Especial) Central, Colombia
IT Services and IT Consulting · 51-200 employees
About the role
Lead the global strategy for technological resilience, reliability, and scalability while implementing end-to-end observability for critical business platforms. Direct automation initiatives, manage technical debt, and oversee performance testing to ensure operational continuity.
What they look for
Requirements
Requires a university degree in Systems, Software, or Electronic Engineering with 5 to 6 years of experience in IT operations or software architecture. Candidates must have at least 2 years of leadership experience in SRE, DevOps, or Performance Engineering.
Full description
🧠 ¡Buscamos Especialista de Observabilidad & SRE)! 🧠
¿Te apasiona transformar operaciones tecnológicas tradicionales en ecosistemas resilientes, automatizados y observables, liderando equipos de alto desempeño que garanticen disponibilidad, rendimiento y continuidad de plataformas críticas de negocio?
🎯 Objetivo del rol:
Serás responsable de liderar la evolución de la operación tecnológica hacia un modelo proactivo basado en principios de Site Reliability Engineering (SRE), observabilidad avanzada y automatización. Tendrás un rol estratégico en la definición de estándares de confiabilidad, resiliencia y rendimiento sobre plataformas empresariales de misión crítica. Además, dirigirás iniciativas de reducción de deuda técnica, adopción de capacidades de autocuración (Self-Healing) y fortalecimiento de la continuidad operativa en entornos híbridos.
🎓 Requisitos del perfil
- Formación académica: Profesional universitario en Ingeniería de Sistemas, Ingeniería de Software, Ingeniería Electrónica o carreras afines de base tecnológica.
- Experiencia: Mínimo 5 a 6 años de experiencia en infraestructura tecnológica, operaciones TI o arquitectura de software, con al menos 2 años liderando equipos de SRE, DevOps o Ingeniería de Rendimiento.
Conocimientos obligatorios:
- ☁️ Cloud: AWS, Azure, ecosistemas híbridos On-Premise y Multi-Cloud
- ⚙️ DevOps y CI/CD: Terraform, Ansible, Infrastructure as Code (IaC), automatización de infraestructura
- 🏛️ Arquitectura: Resiliencia tecnológica, escalabilidad, transición arquitectónica, reducción de deuda técnica, Clean Core
- 🧭 Liderazgo y Metodologías: Site Reliability Engineering (SRE), DevOps, ITIL v4, gestión de SLI/SLO, Blameless Post-Mortems, gestión de incidentes mayores
- 🔗 ERP / SAP: Arquitectura de ecosistemas SAP de misión crítica, S/4HANA, EWM, IBP, BTP, metodologías de despliegue SAP
- 🔧 Otros: Observabilidad end-to-end, telemetría avanzada, monitoreo distribuido, ingeniería de rendimiento, pruebas de carga, pruebas de estrés, Chaos Engineering
Conocimientos deseables:
- 🔧 Otros: Certificación en SRE, certificaciones en herramientas de observabilidad, certificaciones en arquitectura Cloud o metodologías SAP
💡 Competencias personales
- Liderazgo estratégico de equipos multidisciplinarios.
- Pensamiento analítico orientado a la confiabilidad operativa.
- Capacidad de toma de decisiones bajo escenarios críticos.
- Comunicación efectiva con áreas técnicas y de negocio.
- Orientación a la mejora continua y la innovación tecnológica.
⚙️ Responsabilidades principales
- Liderar la estrategia global de resiliencia, confiabilidad y escalabilidad tecnológica.
- Diseñar e implementar capacidades de observabilidad de extremo a extremo sobre plataformas empresariales críticas.
- Definir métricas, indicadores y objetivos de nivel de servicio alineados con el negocio.
- Dirigir iniciativas de automatización y autocuración para reducir la intervención manual en incidentes repetitivos.
- Supervisar pruebas de carga, estrés y simulaciones de fallas para validar la estabilidad de los servicios.
- Liderar análisis de causa raíz bajo enfoques Blameless, promoviendo la mejora continua.
- Gestionar programas de reducción de deuda técnica y fortalecimiento arquitectónico.
- Asegurar la disponibilidad operativa durante procesos de transformación tecnológica y modernización de plataformas.
- Coordinar y desarrollar equipos especializados en SRE, DevOps y rendimiento.
- Presentar riesgos, planes de remediación y estrategias de continuidad operativa a la dirección tecnológica.
🕒 Condiciones laborales
- 📍 Ubicación: Hibrido (Sopó 4x1)
- 🧩 Tipo de contrato: Nomina
- ⏰ Horario: Tiempo completo
- 💰 Salario: A convenir
🌐 TALYCAP GLOBAL – Conectamos el mejor talento IT con proyectos de alto impacto.
#LiderSRE #SiteReliabilityEngineering #Observabilidad #TalycapGlobal
Similar roles
-
Site Reliability Engineer
Armor Defense Inc Pune, Maharashtra, India
-
Senior Site Reliability Engineer
Formation Bio San Francisco, California, United States · $186K–$232K/yr
-
Staff Site Reliability Engineer
Okta Dublin, Leinster, Ireland · €92K–€126K/yr
-
Senior Site Reliability Engineer
Okta Dublin, Leinster, Ireland · €76K–€104K/yr
-
Site Reliability Engineer Engineer
Modus Create United States
-
SRE
Zensar Bangalore South, Karnataka, India