Talycap Global

Especialista de Observabilidad & SRE

Talycap Global Bogota, RAP (Especial) Central, Colombia

IT Services and IT Consulting · 51-200 employees

Sep 09
sre Senior (5-10 yrs) Full-time Colombia
Create a free account to apply — email only, no card. You can also save this posting or score it against your profile with AI.

About the role

Lead the global strategy for technological resilience, reliability, and scalability while implementing end-to-end observability for critical business platforms. Direct automation initiatives, manage technical debt, and oversee performance testing to ensure operational continuity.

What they look for

Site Reliability Engineering Observability AWS Azure Terraform Ansible Infrastructure as Code SAP S/4HANA Chaos Engineering Performance Engineering ITIL v4 DevOps CI/CD System Architecture Telemetry Incident Management

Requirements

Requires a university degree in Systems, Software, or Electronic Engineering with 5 to 6 years of experience in IT operations or software architecture. Candidates must have at least 2 years of leadership experience in SRE, DevOps, or Performance Engineering.

Full description

🧠 ¡Buscamos Especialista de Observabilidad & SRE)! 🧠

¿Te apasiona transformar operaciones tecnológicas tradicionales en ecosistemas resilientes, automatizados y observables, liderando equipos de alto desempeño que garanticen disponibilidad, rendimiento y continuidad de plataformas críticas de negocio?

🎯 Objetivo del rol:

Serás responsable de liderar la evolución de la operación tecnológica hacia un modelo proactivo basado en principios de Site Reliability Engineering (SRE), observabilidad avanzada y automatización. Tendrás un rol estratégico en la definición de estándares de confiabilidad, resiliencia y rendimiento sobre plataformas empresariales de misión crítica. Además, dirigirás iniciativas de reducción de deuda técnica, adopción de capacidades de autocuración (Self-Healing) y fortalecimiento de la continuidad operativa en entornos híbridos.

🎓 Requisitos del perfil

  • Formación académica: Profesional universitario en Ingeniería de Sistemas, Ingeniería de Software, Ingeniería Electrónica o carreras afines de base tecnológica.
  • Experiencia: Mínimo 5 a 6 años de experiencia en infraestructura tecnológica, operaciones TI o arquitectura de software, con al menos 2 años liderando equipos de SRE, DevOps o Ingeniería de Rendimiento.

Conocimientos obligatorios:

  • ☁️ Cloud: AWS, Azure, ecosistemas híbridos On-Premise y Multi-Cloud
  • ⚙️ DevOps y CI/CD: Terraform, Ansible, Infrastructure as Code (IaC), automatización de infraestructura
  • 🏛️ Arquitectura: Resiliencia tecnológica, escalabilidad, transición arquitectónica, reducción de deuda técnica, Clean Core
  • 🧭 Liderazgo y Metodologías: Site Reliability Engineering (SRE), DevOps, ITIL v4, gestión de SLI/SLO, Blameless Post-Mortems, gestión de incidentes mayores
  • 🔗 ERP / SAP: Arquitectura de ecosistemas SAP de misión crítica, S/4HANA, EWM, IBP, BTP, metodologías de despliegue SAP
  • 🔧 Otros: Observabilidad end-to-end, telemetría avanzada, monitoreo distribuido, ingeniería de rendimiento, pruebas de carga, pruebas de estrés, Chaos Engineering

Conocimientos deseables:

  • 🔧 Otros: Certificación en SRE, certificaciones en herramientas de observabilidad, certificaciones en arquitectura Cloud o metodologías SAP

💡 Competencias personales

  • Liderazgo estratégico de equipos multidisciplinarios.
  • Pensamiento analítico orientado a la confiabilidad operativa.
  • Capacidad de toma de decisiones bajo escenarios críticos.
  • Comunicación efectiva con áreas técnicas y de negocio.
  • Orientación a la mejora continua y la innovación tecnológica.

⚙️ Responsabilidades principales

  • Liderar la estrategia global de resiliencia, confiabilidad y escalabilidad tecnológica.
  • Diseñar e implementar capacidades de observabilidad de extremo a extremo sobre plataformas empresariales críticas.
  • Definir métricas, indicadores y objetivos de nivel de servicio alineados con el negocio.
  • Dirigir iniciativas de automatización y autocuración para reducir la intervención manual en incidentes repetitivos.
  • Supervisar pruebas de carga, estrés y simulaciones de fallas para validar la estabilidad de los servicios.
  • Liderar análisis de causa raíz bajo enfoques Blameless, promoviendo la mejora continua.
  • Gestionar programas de reducción de deuda técnica y fortalecimiento arquitectónico.
  • Asegurar la disponibilidad operativa durante procesos de transformación tecnológica y modernización de plataformas.
  • Coordinar y desarrollar equipos especializados en SRE, DevOps y rendimiento.
  • Presentar riesgos, planes de remediación y estrategias de continuidad operativa a la dirección tecnológica.

🕒 Condiciones laborales

  • 📍 Ubicación: Hibrido (Sopó 4x1)
  • 🧩 Tipo de contrato: Nomina
  • ⏰ Horario: Tiempo completo
  • 💰 Salario: A convenir

🌐 TALYCAP GLOBAL – Conectamos el mejor talento IT con proyectos de alto impacto.

#LiderSRE #SiteReliabilityEngineering #Observabilidad #TalycapGlobal

Similar roles