About this role
Dans le cadre d'une longue mission d'intérim, nous recherchons un ou une Ingénieur de production (H/F) sur CSaint-Jean-de-Braye (45) Missions : - Assurer le maintien en conditions opérationnelles des services, infrastructures et plateformes conformément aux objectifs de disponibilité et de qualité de service - Participer au dispositif d'astreinte selon un roulement d'une semaine toutes les cinq semaines, incluant les soirs, week-ends et jours fériés - Surveiller et analyser les événements, alertes et incidents de production, assurer leur diagnostic, leur traitement et leur coordination avec les équipes concernées - Anticiper les incidents par l'analyse des tendances, des capacités, des signaux faibles et des risques identifiés sur les plateformes - Réaliser les analyses post-incidents, identifier les causes racines et piloter les plans d'actions de fiabilisation - Maintenir et faire évoluer les tableaux de bord, indicateurs, et alertes d'observabilité - Réduire le bruit opérationnel en optimisant les règles d'alerting et en réduisant le volume d'alertes non pertinentes - Participer aux cellules d'incident, de crise et aux démarches d'amélioration continue de la production - Contribuer à l'automatisation, à l'industrialisation et à la simplification des activités d'exploitation - Maintenir et enrichir la documentation, les procédures et les référentiels de l'activité Définition des missions et des obligations afférentes (obligation de conseil et/ou obligation de résultat) au Titulaire Dans le cadre de la mission, le profil exercera une activité d'Observabilité, Fiabilité et Support de Production. Les compétences suivantes constituent des prérequis : - Maîtrise des concepts et pratiques Site Reliability Engineering (SRE) - Très bonne maîtrise des outils de supervision, monitoring, gestion des logs, trace, métriques et alerting - Aisance dans les environnements conteneurisés et orchestrés (Docker, Kubernetes ou technologies équivalentes) - Bonne compréhension des architectures distribuées, microservices et infrastructures modernes - Expérience de l'automatisation et des pratiques DevOps - Capacité à diagnostiquer et résoudre des incidents complexes - Aptitude à travailler en coordination avec plusieurs équipes techniques Environnement technique : Périmètre existant - 8 000 serveurs dans deux salles informatiques et un site de secours - 160 applications (Java) - Environnements virtualisés (VMware) - Déploiements Conteneurisés (Kubernetes) Système de Supervision et d'Exploitation : - Prometheus, Grafana, Centreon, Splunk, Tempo