Principales responsabilités
Concevoir et développer des pipelines de données en mode batch et temps réel pour la collecte, le traitement, le stockage et la mise à disposition des données.
Définir des modèles de données et concevoir des architectures de type Data Warehouse, Data Lake ou Lakehouse adaptées aux besoins métier.
Mettre en place des contrôles de qualité des données, assurer leur traçabilité (data lineage), gérer les droits d'accès et superviser les flux de données.
Collaborer avec les Data Scientists et les Ingénieurs Machine Learning afin de fournir les jeux de données nécessaires au feature engineering et à l'entraînement des modèles.