Analista de SRE Pleno - Vaga Afirmativa para Mulheres
Experian Sao Carlos, Southeast, Brazil
Information Services · 1,001-5,000 employees
About the role
You will design, operate, and improve the reliability, scalability, and performance of cloud-native platforms supporting critical business applications and AI/ML workloads. The role involves automating operations, managing incident responses, and collaborating with engineering teams to establish best practices for infrastructure and data platforms.
What they look for
Requirements
Candidates must have solid experience in Site Reliability Engineering, DevOps, or Cloud Engineering with strong proficiency in AWS and Kubernetes. A background in managing large-scale distributed systems, infrastructure as code, and observability tools like Datadog is required.
Benefits
Full description
Company Description
A Experian é uma empresa global de dados e tecnologia que impulsiona oportunidades para pessoas e empresas ao redor do mundo. Atuamos em diversos mercados, como serviços financeiros, saúde, automotivo, agronegócio, seguros, entre outros. A Experian investe em pessoas e em novas tecnologias avançadas para liberar o poder dos dados. Contamos com uma equipe incrível de 25.200 colaboradores em 32 países.
Nossa singularidade é valorizar a sua. A cultura da Experian, centrada nas pessoas, inclusiva e orientada por propósito, é reconhecida por diversos prêmios — incluindo World’s Best Workplaces™ 2025 (Top 25 global da Fortune) e Great Place To Work™ em 26 países, entre outros. Confira o Experian Life nas redes sociais ou explore nosso site de carreiras para entender o porquê. A Experian também se orgulha de ser uma empregadora que promove igualdade de oportunidades e ação afirmativa.
Job Description
Estamos em busca de uma Site Reliability Engineer (SRE) Plena altamente motivada para integrar nossa equipe de Cloud, Data & AI Platform. Nesta função, você será responsável por projetar, operar e aprimorar continuamente a confiabilidade, escalabilidade, observabilidade e desempenho de plataformas cloud-native que suportam aplicações críticas para o negócio, pipelines de dados e cargas de trabalho de IA/ML.
Você trabalhará em estreita colaboração com as equipes de Engenharia de Software, Engenharia de Dados, Engenharia de IA e Plataforma para criar sistemas resilientes, automatizar operações, melhorar a experiência dos desenvolvedores e estabelecer as melhores práticas de confiabilidade em toda a organização.
Como engenheira plena, você desempenhará um papel fundamental no avanço da excelência operacional por meio de automação, observabilidade, gestão de incidentes, otimização de custos e modernização da infraestrutura.
Principais Responsabilidades:
- Projetar e operar plataformas em nuvem altamente disponíveis, escaláveis e seguras na AWS.
- Construir e manter infraestrutura baseada em Kubernetes para suportar aplicações, dados e cargas de trabalho de IA.
- Melhorar a confiabilidade da plataforma por meio de automação, Infraestrutura como Código (IaC) e recursos de autoatendimento (self-service).
- Implementar e aprimorar soluções de observabilidade utilizando Datadog, incluindo monitoramento, logs, rastreamento (tracing), alertas, dashboards e gestão de SLOs.
- Suportar e otimizar ambientes de processamento de dados em larga escala utilizando Airflow, Amazon EMR, S3 e outros serviços de dados da AWS.
- Trabalhar em parceria com as equipes de Dados e IA para melhorar a confiabilidade, escalabilidade e maturidade operacional de plataformas de Machine Learning e Inteligência Artificial.
- Liderar atividades de resposta a incidentes, análises de causa raiz e revisões pós-incidente, promovendo a melhoria contínua.
- Definir e medir Indicadores de Nível de Serviço (SLIs), Objetivos de Nível de Serviço (SLOs) e orçamentos de erro (error budgets).
- Aprimorar processos de implantação, pipelines de CI/CD e a confiabilidade das releases.
- Otimizar a utilização, desempenho e custos da infraestrutura em nuvem.
- Mentorar membros da equipe e promover as melhores práticas de SRE em toda a organização de engenharia.
O que define o sucesso nessa função
- Aumento da disponibilidade e confiabilidade da plataforma.
- Melhoria da observabilidade e redução do tempo de resolução de incidentes.
- Maior automação e redução de esforços operacionais manuais e repetitivos.
- Plataformas de Dados e IA confiáveis, escaláveis e com eficiência de custos.
- Forte colaboração com as equipes de Engenharia para entregar sistemas de produção resilientes.
Qualifications
Qualificações obrigatórias
- Ensino Superior cursando/completo.
- Experiência sólida em Site Reliability Engineering, Platform Engineering, Cloud Engineering ou funções de DevOps.
- Forte experiência prática com serviços AWS e arquiteturas cloud-native.
- Conhecimento profundo de Kubernetes e workloads conteinerizadas em ambientes de produção.
- Experiência na gestão e resolução de problemas em sistemas distribuídos de grande escala.
- Sólida experiência com plataformas de observabilidade, preferencialmente Datadog.
- Experiência no suporte a plataformas e fluxos de dados utilizando tecnologias como Airflow, EMR, Spark e S3.
- Expertise em Infraestrutura como Código (IaC) utilizando Terraform ou ferramentas similares.
- Experiência na construção e manutenção de pipelines de CI/CD e automação de plataformas.
- Sólidos conhecimentos em Linux, redes e troubleshooting de desempenho de sistemas.
- Proficiência em scripts e automação utilizando Python, Bash ou linguagens similares.
Qualificações desejáveis
- Experiência no suporte a plataformas cloud-native de grande escala em ambientes AWS.
- Experiência com operações de plataformas Kubernetes e gerenciamento do ciclo de vida de clusters.
- Conhecimento dos princípios de Site Reliability Engineering, incluindo SLOs, SLIs, error budgets e práticas de excelência operacional.
- Experiência na implementação de soluções de observabilidade utilizando ferramentas como Datadog, Prometheus, Grafana, OpenTelemetry ou tecnologias similares.
- Familiaridade com plataformas de processamento de dados e orquestração de workflows, como Airflow, Spark ou EMR.
- Experiência com Infraestrutura como Código (IaC) e práticas de automação de plataformas.
- Certificações AWS, Kubernetes, Terraform ou Datadog.
- Experiência atuando em ambientes corporativos de grande escala, altamente disponíveis ou de missão crítica.
- Inglês técnico intermediário.
Additional Information
Esta é uma posição afirmativa para mulheres, como parte do nosso compromisso com o avanço da equidade de gênero no ambiente de trabalho.
A Serasa Experian investe na liderança feminina e possui a parceria com a TODAS Group. Além disso, aderimos ao Movimento 'Elas Lideram 2030’, e nos unimos à ONU Mulheres para reduzir a desigualdade de gênero até 2030!!
Temos também o grupo Women in Experian que busca melhorar a equidade de gênero para mulheres, criando oportunidades de desenvolvimento, diferentes perspectivas, habilidades, entre outros.
Venha fazer parte dessa transformação!
Caso você não se identifique com este grupo, convidamos você a explorar outras oportunidades em nossa página de carreiras. Temos diversas vagas que podem se conectar com seu perfil e interesses.
#LI-HOME
Experian Careers - Creating a better tomorrow together
Find out what its like to work for Experian by clicking here
- Employee Status: Regular
- Role Type: Home
- Department: Technology
- Schedule: Full Time
Similar roles
-
Senior Site Reliability Engineer I
Axon Seattle, Washington, United States · $134K–$215K/yr
-
Senior Site Reliability Engineer
Akamai Cambridge, Massachusetts, United States · $186K–$219K/yr
-
Site Reliability Engineer II
Akamai United States · $138K–$171K/yr
-
Site Reliability Engineer (SRE) Manager
Plume Ljubljana, Slovenia
-
Senior Site Reliability Engineer (SRE)
Tubi - Canada Toronto, Ontario, Canada · CA$116K–CA$235K/yr
-
Ingénieur SRE / SecOps Confirmé - F/H
Esker Villeurbanne, Auvergne-Rhone-Alpes, France