IPolarity LLC

Technical Program Manager SRE Kubernetes Cloud AI

IPolarity LLC Hanover Township, New Jersey, United States · $104K–$114K/yr

Staffing and Recruiting · 51-200 employees

Yesterday
Remote kubernetes Principal (10+ yrs) Full-time United States
Log in to apply, save this posting, or score it against your profile with AI.

About the role

Lead complex initiatives focused on platform reliability, observability, and automation across large-scale systems. Collaborate with cross-functional teams to drive SRE best practices, incident management, and continuous improvement.

What they look for

Kubernetes SRE Cloud Automation Python Java Node.js Datadog Splunk Grafana AppDynamics Apigee Microservices High Availability Disaster Recovery Generative AI AIOps

Requirements

Requires 10-14 years of experience with strong expertise in Kubernetes, cloud automation, and reliability engineering. Proficiency in Python, Java, Node.js, and modern observability tools is essential for this role.

Benefits

Flexible work from home

Full description

Hiring: Technical Program Manager – SRE / Kubernetes / Cloud / AI

We are hiring an experienced Program Manager to lead complex technology initiatives focused on platform reliability, observability, automation, and application performance across large-scale systems.

📍 Location: Hartford, CT 💼 Experience: 10–14 Years

🔹 Key Responsibilities

  • Lead complex SRE, cloud, Kubernetes, and platform reliability initiatives
  • Manage and improve Kubernetes platforms, including GKE and Rancher RKE2
  • Build automation and operational tools using Python, Java, and Node.js
  • Leverage Generative AI/LLMs such as Gemini, Llama, Mistral, and Qwen for alert analysis, incident response, and operational automation
  • Implement reliable API and microservices solutions using Apigee/Apigee X, REST APIs, GraphQL, traffic routing, canary deployments, and failover strategies
  • Drive high availability, active-active deployments, disaster recovery, and multi-datacenter Kubernetes environments
  • Develop and enhance observability using Splunk, Datadog, Grafana, and AppDynamics
  • Drive SRE best practices, incident management, reliability engineering, and continuous improvement
  • Collaborate with cross-functional engineering, operations, and business teams to deliver measurable outcomes

🔹 Ideal Candidate We are looking for a Technical Program Manager / SRE leader with strong hands-on understanding of: ✅ Kubernetes & GKE ✅ SRE & Cloud Automation ✅ Python / Java / Node.js ✅ Datadog / Splunk / Grafana / AppDynamics ✅ Apigee & API/Microservices Reliability ✅ High Availability & Disaster Recovery ✅ GenAI / LLM / AIOps ✅ Technical Program & Cross-Functional Leadership

Flexible work from home options available.

Similar roles