Especialista em Infraestrutura | SRE
XP Inc. São Paulo, São Paulo, Brazil
Financial Services · 5,001-10,000 employees
About the role
Lead reliability strategy for the corporate platform, including SLOs, capacity planning, disaster recovery, and Chaos Engineering. Design resilient systems at scale, improve observability and performance, mentor SREs, lead blameless postmortems, and drive adoption of reliability engineering practices.
What they look for
Requirements
Requires at least eight years of infrastructure, SRE, systems engineering, or architecture experience, including extensive production experience with Kubernetes, Kafka, RabbitMQ, Linux, and advanced TCP/IP networking. Candidates must have strong distributed-systems architecture and observability skills, automation experience with Terraform, Ansible, Python or Go, and GitOps, plus a relevant completed bachelor's degree.
Benefits
Full description
Sobre nós
A XP Inc. é uma das maiores instituições financeiras independente do Brasil, dona das marcas XP, Rico, Clear, XP Educação, InfoMoney, entre outras. Com mais de 4,6 milhões de clientes ativos e um valor superior a R$ 1,1 trilhão de ativos sob custódia, há 25 anos vem transformando o mercado financeiro para melhorar a vida das pessoas.
Com uma cultura marcante guiada por quatro valores - Sonho Grande, Espírito Empreendedor, Foco no Cliente e Mente Aberta - a XP Inc. está sempre em busca dos melhores talentos que tem ambição de fazer o impossível.
🚀 Sobre a Oportunidade
Estamos em busca de um Especialista SRE para atuar como a maior referência técnica de confiabilidade da nossa plataforma corporativa. Essa é uma posição para quem respira sistemas distribuídos, vive troubleshooting de nível kernel e tem a maturidade para projetar arquiteturas que operam sozinhas. Você será a pessoa chamada quando ninguém mais consegue resolver — liderando a estratégia de SLOs, capacity planning, disaster recovery e Chaos Engineering. Se você desenha sistemas resilientes em escala e quer impactar milhões de transações por dia, esse é o seu lugar.
Saiba mais sobre nosso dia a dia no Instagram e no LinkedIn.
Confira nossas avaliações no Glassdoor.
🔍 O Que Procuramos
Pré-requisitos Essenciais:
- Mínimo de 8 anos de experiência em infraestrutura de TI, SRE, engenharia de sistemas ou arquitetura
- 5+ anos com Kubernetes em produção em larga escala (100+ nodes)
- 3+ anos com Apache Kafka em produção (100+ brokers, milhões de mensagens/segundo)
- 3+ anos com RabbitMQ em produção em larga escala
- 5+ anos com Linux em produção — incluindo kernel internals, eBPF, cgroups, performance analysis
- Domínio avançado de redes TCP/IP (BGP, VXLAN, eBPF/XDP, tuning de performance)
- Experiência sólida com observabilidade (OpenTelemetry, distributed tracing, PromQL avançado)
- Automação com Terraform, Ansible, Python/Go e GitOps
- Experiência comprovada com arquitetura de sistemas distribuídos
- Ensino superior completo em Ciência da Computação, Engenharia da Computação ou áreas correlatas
Diferenciais:
- Experiência como maintainer ou committer de projetos open source (Kubernetes, Kafka, Prometheus, eBPF)
- Palestrante em conferências internacionais (KubeCon, SREcon, QCon, DevOpsDays)
- Experiência em empresas FAANG ou equivalentes
- Service Mesh (Istio, Envoy, Linkerd) em produção em larga escala
- Arquiteturas multi-cloud ou hybrid cloud
- Storage distribuído (Ceph, MinIO, Longhorn, Portworx)
- Machine Learning para operações (AIOps/MLOps)
- Certificações: CKA + CKAD + CKS, RHCA, AWS SA Professional, Confluent Certified Administrator
- Experiência com regulamentações (BACEN, CVM, LGPD, SOC2, ISO 27001, PCI-DSS)
🎯 Desafios e Impacto
- Escala: Projetar sistemas que operam com milhões de transações por segundo, garantindo performance e resiliência
- Disponibilidade: Sustentar SLOs de 99.99%+ — menos de 1 hora de downtime por ano
- Complexidade: Atuar em ambientes com centenas de microsserviços, dezenas de clusters e múltiplos datacenters
- Liderança técnica: Ser a autoridade máxima do time, mentoreando SREs plenos e juniores e conduzindo postmortems sem blame
- Inovação: Implementar Chaos Engineering, observabilidade avançada (eBPF, distributed tracing) e estratégias de disaster recovery
- Evolução cultural: Liderar a transformação da organização para adotar práticas de engenharia de confiabilidade em escala
⏳ Etapas do Processo
• Triagem inicial: Análise do currículo para verificar a adequação às qualificações e requisitos da vaga.
• Testes gerais: Avaliação do alinhamento cultural com o teste da Mindsight e teste de raciocínio lógico da Predictive Index.
• Vídeo entrevista: Uma oportunidade para nos conhecermos melhor e entender suas motivações e experiências.
• Entrevista com a equipe de Recrutamento: Discussão sobre as expectativas em relação à vaga e aos objetivos profissionais.
• Avaliação técnica: Entrevista focada nas habilidades específicas necessárias para a função.
• Entrevista com a liderança: Uma conversa para discutir sua visão e como você pode contribuir para a equipe e a empresa.
• Entrevista com colegas de trabalho: Interação com futuros pares para avaliar a sinergia e o trabalho em equipe.
• Entrevista focada em cultura: Exploração dos valores e princípios da empresa para garantir um bom encaixe cultural.
• Oferta: Apresentação da proposta de trabalho, incluindo detalhes sobre remuneração e benefícios.
Benefícios:
Saúde e bem-estar:
- Plano de saúde
- Plano odontológico
- Wellhub (Gympass)
- Zenklub
- Seguro de Vida
- iFood Benefícios (VA e VR flexível)
- Vale Transporte
- New Value (clube de benefícios)
- Licença parental: maternidade de 6 meses e paternidade de 20 dias.
- Auxílio Creche
Vida Financeira
- Fundos de Investimentos Exclusivos
- Assessoria de Investimentos
- Cartão XP Visa Infinite sem anuidade
- Crédito (consignado, home equity, CCB Imobiliário, etc.)
Modelo de Trabalho Presencial Flexível
O nosso modelo de trabalho varia de acordo com a função, podendo ser totalmente presencial para frentes de negócio e mais flexível para outras equipes.
Seguimos um modelo com mais frequência presencial, mas sempre guiado por flexibilidade e autonomia com a responsabilidade da nossa cultura empreendedora.
Aqui na XP Inc., valorizamos as interações pessoais e acreditamos no uso do escritório como uma ferramenta para potencializar nossas relações no trabalho.
*Ao seguir com a inscrição, você declara que leu, compreendeu e concorda com a Política de Privacidade do Grupo XP Inc. e de seus fornecedores e parceiros que apoiam com a realização do processo seletivo. O Grupo XP Inc. poderá utilizar de soluções de inteligência artificial para apoiar a equipe de recrutamento no decorrer do processo, o que poderá envolver o tratamento de seus dados pessoais para tal finalidade, conforme princípios da Lei Geral de Proteção de Dados e da Política de Privacidade do Grupo XP Inc.
Similar roles
-
Staff Site Reliability Engineer
Anduril Industries Costa Mesa, California, United States · $191K–$253K/yr
-
Senior Site Reliability Engineer - Platform Reliability (Resilience)
Elastic Poland · PLN 359K–PLN 465K/yr
-
Junior Site Reliability Engineer
Semarchy United States
- Site Reliability Engineer
-
Senior Site Reliability Engineer (Copy) (Copy) (Copy)
Supio Seattle, Washington, United States · $200K–$240K/yr
-
Senior Site Reliability Engineer, SecOps
Cambridge Mobile Telematics Cambridge, Massachusetts, United States · $118K–$148K/yr