Site Reliability & Observability Engineer (SRE)
- TUM - D.F. Del. Miguel Hidalgo
- Full-time
- POSTED 2 DAYS AGO
About the job
TransUnion's Job Applicant Privacy Notice
Team Overview
The Reliability Engineering team ensures the stability, availability, and performance of Buró de Crédito’s mission-critical platforms and El equipo de Reliability Engineering es responsable de garantizar la estabilidad, disponibilidad y desempeño de las plataformas y servicios críticos para el negocio de Buró de Crédito. Mediante prácticas de observabilidad, automatización y gestión de incidentes, impulsa la excelencia operativa y la mejora continua en entornos de misión crítica. El equipo colabora estrechamente con las áreas de Infraestructura, Desarrollo, Bases de Datos y Seguridad para mantener sistemas resilientes y escalables. Este rol reporta al líder del equipo de Reliability Engineering.
This job is assigned as On-Site Essential and requires in- person work at an assigned TU office location as a condition of employment. Role Overview And Core Responsibilities
El Site Reliability & Observability Engineer (SRE) es responsable de garantizar la confiabilidad, estabilidad y disponibilidad de servicios críticos mediante la adopción de mejores prácticas de Site Reliability Engineering. Este rol impulsa la excelencia operativa a través de observabilidad, automatización y mejora continua, reduciendo riesgos operativos y fortaleciendo la resiliencia de la plataforma.
Garantizar la confiabilidad, estabilidad y disponibilidad de servicios de misión crítica mediante prácticas de Site Reliability Engineering (SRE). Operar y evolucionar continuamente la plataforma de observabilidad, incluyendo métricas, registros, trazas distribuidas y capacidades de alertamiento. Monitorear proactivamente sistemas críticos y responder a incidentes operativos para minimizar interrupciones y el impacto al negocio. Liderar actividades de respuesta ante incidentes mayores, coordinando esfuerzos de recuperación y comunicación con las partes interesadas. Ejecutar análisis de causa raíz (RCA) y facilitar revisiones posteriores a incidentes para prevenir recurrencias y fortalecer la resiliencia operativa. Definir, medir y optimizar Service Level Indicators (SLIs), Service Level Objectives (SLOs) y presupuestos de error (Error Budgets). Automatizar procesos operativos y reducir actividades manuales mediante scripting, automatización de infraestructura y prácticas de ingeniería de plataformas. Brindar soporte y resolución de problemas en entornos distribuidos que incluyen Apache Cassandra, Apache Kafka, Kubernetes, bases de datos relacionales y plataformas NoSQL. Colaborar con equipos de desarrollo e infraestructura para mejorar la confiabilidad de despliegues, preparación operativa y desempeño general de la plataforma. Required Knowledge And Experiences
Licenciatura en Ciencias de la Computación, Ingeniería en Sistemas, Telecomunicaciones o disciplina técnica relacionada, o experiencia equivalente demostrable. Experiencia comprobada en Site Reliability Engineering (SRE), Operaciones de Producción, Platform Engineering, Infrastructure Engineering o funciones enfocadas en confiabilidad. Conocimiento sólido de sistemas distribuidos, observabilidad, gestión de incidentes y metodologías avanzadas de resolución de problemas en entornos críticos. Experiencia liderando incidentes mayores, procesos de análisis de causa raíz, restauración de servicios e iniciativas de excelencia operativa. Conocimiento de marcos de confiabilidad, incluyendo SLOs, SLIs, Error Budgets, mejora continua y mejores prácticas de gestión de servicios. Habilidades técnicas requeridas Administración y soporte de plataformas Kubernetes en entornos empresariales. Experiencia con Apache Cassandra y Apache Kafka en arquitecturas distribuidas. Conocimiento de herramientas de observabilidad para monitoreo, registros, trazabilidad y alertamiento. Capacidad para automatizar tareas operativas mediante scripting e infraestructura como código (IaC). Experiencia con bases de datos relacionales y tecnologías NoSQL en ambientes de alta disponibilidad. Habilidades Deseadas: También se buscan las siguientes habilidades. Ya sea que se dominen o estén en desarrollo, se apoya el crecimiento profesional en: Experiencia en ingeniería de plataformas y modernización de operaciones tecnológicas. Conocimiento de prácticas DevOps y procesos CI/CD. Experiencia en optimización de rendimiento y escalabilidad de plataformas empresariales. Habilidades para impulsar iniciativas de mejora continua y eficiencia operativa. Capacidad de colaboración efectiva con equipos multidisciplinarios en entornos complejos y dinámicos. #LI-GL1,#LI-Hybrid
TransUnion Overview:
At TransUnion, we encourage and are committed to creating a real, positive impact and shared sense of purpose within our Workforce for Good, which empowers our people to grow, innovate and contribute to a better future for our communities and customers. We strive to build an environment where our associates are in the driver’s seat of their professional development- while having access to help along the way. We recognize that success comes when our associates thrive both professionally and personally; that’s why we prioritize work/life flexibility and offer resources for our teams across the globe to collaborate and drive excellence.
Be a part of our Workforce for Good – you’ll work with great people, pioneering products and cutting-edge technology.
TransUnion Job Title
Sr Engineer, Infrastructure Engineering and Provisioning