About this role
Responsabilidades Principales:Garantizar que los sistemas de producción estén disponibles y operen de acuerdo con los Acuerdos de Nivel de Servicio (SLA) definidos Liderar la resolución de incidentes e interrupciones del servicio, manteniendo una comunicación clara y oportuna con las partes involucradas Facilitar la restauración eficiente de los servicios en el entorno de producción Establecer y mantener procedimientos de recuperación ante desastres (Disaster Recovery) para proteger las operaciones críticas Gestionar las prácticas de retención de datos para asegurar el cumplimiento normativo y la continuidad operativa. ????? ¿Que necesitas para este role?: Experiencia práctica con Dynatrace (dashboards, monitoreo sintético, alertas, integraciones) y Nagios (desarrollo de plugins, configuración de hosts/servicios, ajuste de rendimiento). Experiencia en Grafana: configuración de datasources, creación de dashboards, alerting y gestión de usuarios. Manejo de herramientas nativas de monitoreo cloud: AWS CloudWatch, GCP Cloud Monitoring / Operations Suite, Azure Monitor y OCI Monitoring. ?Bonus points: Manejo de plataformas adicionales de monitoreo como AppManager, OpManager o Site24x7. Conocimiento de entornos contenerizados (Kubernetes, Docker) y sus soluciones de observabilidad nativas. Certificación Dynatrace Associate o Professional, AWS CloudWatch o equivalente de nube es un plus