About this role
Taux journalier (TJM): 480€/jour CONTEXTE Au sein du département IT d'une grande institution financière (DSI Corporate), la DSI T&O et BPA a pour vocation de fournir aux services Technologies & Opérations (pôles Global Business Management and Transformation (GBMT), WorkPlace, CIO Office Groupe) et Banque de Proximité et Assurance (BPA), l'ensemble des applications nécessaires à leur fonctionnement. MISSIONS Nous recherchons un profil Hadoop / PySpark qui sera en charge, en lien avec l'équipe de production applicative / devops, de mettre en œuvre techniquement les évolutions du datalake CIO Office. Passionné par le développement et le traitement des données, capable de s'adapter à un environnement dynamique et en constante évolution, le candidat doit faire preuve d'autonomie, d'initiative et d'une forte capacité d'analyse pour résoudre des problèmes complexes. Les tâches suivantes seront confiées au consultant : * Mettre en œuvre de nouvelles ingestions de données, data prep/transformation * Maintenir et faire évoluer nos outils de gestion des pipelines de données (Pyspark + shell scripting) * Adresser à l'équipe devops les demandes relatives aux évolutions de la plateforme COMPÉTENCES MÉTIER Développe, construit des infrastructures de données d'un point de vue système et sécurité. * S'assure de la collecte, du stockage et de l'exploitation des flux de données répondant aux enjeux de l'entreprise. * Est garant de l'accès qualitatif des sources de données qui viennent alimenter des espaces de stockage afin d'en faciliter l'exploitation par les Data Scientist et Data Analyst. * Définit également la structure des métadonnées. * Industrialise les modèles de Machine Learning. * Maintient et participe au suivi du RUN des applications/modèles développés. * Cartographie et documente les sources de données. * Assure la maintenance des différentes applications déployées en production et des infrastructures associées. * Conçoit les solutions permettant le traitement de volumes importants de flux de données. * Structure les bases de données (sémantique, format, etc.). * Contribue à la gestion des référentiels de données. * Capte et stocke les données (structurées ou non) produites dans les différentes applications ou venant de l'extérieur de l'entreprise. * Assure la supervision et l'intégration des données de diverses natures qui proviennent de sources multiples. Vérifie la qualité des données et s'assure de leur sécurité. * Assiste les Data Scientists dans l'optimisation des performances techniques des modèles de Machine Learning. * Industrialise les modèles de Machine Learning conçus par les Data Scientists. * Reste en alerte sur les technologies liées au traitement de la manipulation de la donnée et identifie les solutions utilisables. * Propose des évolutions pour les infrastructures et solutions de données en place. CONDITIONS DE TRAVAIL * Expérience : 3 à 6 ans * Démarrage : 28/09 * Dead line : 22/09 * Localisation : Charenton-Le-Pont * Durée mission : 5 mois renouvelable * TJM : 480€ 1. Excellente maîtrise de la plateforme Hadoop, ainsi que du développement en Python/PySpark et Hive 2. Bonne connaissance de SQL, GIT, Jenkins, Jira, et du shell scripting sous Unix/Linux 3. Maîtrise de l'anglais, tant à l'écrit qu'à l'oral 4. Expérience dans des environnements agiles, en particulier avec la méthodologie SCRUM 5. Connaissances et expériences avec des outils et technologies tels que Indexima, Alteryx, Altair, GCP/Big Query, ainsi que des bibliothèques Python orientées API 6. Capacité à rédiger des spécifications techniques claires et précises 7. Dynamisme, excellent relationnel et capacité à travailler en équipe 8. Force de proposition et curiosité technique pour explorer de nouvelles solutions et technologies