> Markdown version of [/jobs/ext/424149-alternant-e-data-engineer-h-f](https://www.wearedevelopers.com/jobs/ext/424149-alternant-e-data-engineer-h-f). Every page supports `.md` or `Accept: text/markdown`. Links point to the HTML versions so they work for humans too. Agent guide: [/agents.md](https://www.wearedevelopers.com/agents.md). --- # Alternant.e Data Engineer H/F - **Company:** Le Groupe MGEN - **Location:** Paris, France - **Experience:** Internship - **Contract:** Apprenticeship - **Skills:** HTML, Artificial Intelligence, Automation of Tests, Databases, Data Dictionary, Extract Transform Load (ETL), Greenplum, Python (Programming Language), Performance Tuning, Markdown, SQL Databases, Scripting, Information Technology - **Published:** June 12, 2026 - **Apply:** https://fr.indeed.com/viewjob?jk=03740ab1acf12548 ## About the Role Vous préparez une formation de niveau Bac+3 à Bac+5 en Informatique, Data, Statistiques ou dans un domaine équivalent. Vous êtes reconnu(e) pour : * Votre rigueur et votre sens du détail, * Votre esprit d'analyse et votre capacité à résoudre des problématiques complexes, * Votre capacité à structurer, documenter et fiabiliser vos travaux, * Votre curiosité pour les sujets liés à la data et à l'intelligence artificielle, * Votre capacité à travailler en équipe et à collaborer avec différents interlocuteurs. * Vous disposez de bonnes bases en SQL et possédez idéalement des connaissances en data engineering (ETL, pipelines de données). Des notions en Python ou dans un langage de scripting constitueraient un atout supplémentaire. Si vous souhaitez développer vos compétences dans les domaines de la data, de l'automatisation et de l'exploitation des données, alors cette alternance est faite pour vous ! ## Description Le Département SI Data porte la réalisation de la stratégie « data centric » de l'entreprise. Au cœur de la transformation engagée du SI, sa mission transverse garantit l'adéquation des plateformes Data & Référentiels pour valoriser l'usage de la data dans une approche « Data as a product ». Au sein de la Data Platform, vous interviendrez sur les outils : * Semarchy xDI (intégration de données) * Greenplum (base de données analytique) * OpenMetadata (catalogue de données) Dans un contexte de structuration de la gouvernance data, l'objectif est d'améliorer : * la documentation des données et des flux * la qualité et la fiabilité des pipelines * les performances des traitements Missions confiées 1. Mise en place d'une documentation automatique des données * Extraire les métadonnées depuis Greenplum (tables, colonnes, volumétrie) * Concevoir un générateur de documentation (Markdown / HTML) * Produire un dictionnaire de données lisible et maintenable * Mettre à jour automatiquement la documentation 2. Documentation des pipelines data (XDI) * Analyser les flux développés dans Semarchy xDI * Extraire les informations clés des pipelines (sources, cibles, transformations) Reconstituer un lineage simplifié des données : source staging * datamart * Générer une documentation standardisée des flux 3. Enrichissement automatisé (IA encadrée) * Générer des descriptions automatiques de tables et pipelines * Résumer des transformations SQL en langage compréhensible * Améliorer la lisibilité de la documentation (validation humaine requise) 4. Mise en place de contrôles qualité (option selon avancement) * Définir des règles de qualité des données : complétude, cohérence, unicité * Implémenter des tests automatisés sur les pipelines * Produire un reporting des anomalies 5. Optimisation des performances * Analyser les requêtes SQL dans Greenplum * Optimiser : indexation, partitionnement, distribution des données * Mesurer les gains de performance et formaliser les bonnes pratiques 6. Contribution au Data Catalog * Alimenter OpenMetadata : descriptions de tables documentation des flux, liens entre données et pipelines * Participer à la structuration de la gouvernance data Livrables attendus * Scripts d'extraction des métadonnées (BDD & pipelines) * Générateur de documentation automatique * Documentation des données et des flux * Optimisations SQL documentées * Guide d'utilisation et bonnes pratiques ## Related Videos - [The Resilience of the World Wide Web](https://www.wearedevelopers.com/videos/1281-the-resilience-of-the-world-wide-web) - [Why Is Software Documentation Still Static – And Why Modern Browsers Deserve Better](https://www.wearedevelopers.com/videos/2054-why-is-software-documentation-still-static-and-why-modern-browsers-deserve-better) - [Kubernetes and Microservices with Multi-Model Databases](https://www.wearedevelopers.com/videos/382-kubernetes-and-microservices-with-multi-model-databases) - [From Messy Queries to Scalable Systems - How Data Engineering actually works](https://www.wearedevelopers.com/videos/100203-from-messy-queries-to-scalable-systems-how-data-engineering-actually-works) - [NoLoJS - Avoiding JavaScript Cruft with HTML and CSS - Aaron T. Grogg](https://www.wearedevelopers.com/videos/1806-nolojs-avoiding-javascript-cruft-with-html-and-css-aaron-t-grogg) - [The 2026 Talent Pivot: Essential Trends for an Evolving Workforce](https://www.wearedevelopers.com/videos/100098-the-2026-talent-pivot-essential-trends-for-an-evolving-workforce) ## Related Articles - [Data Engineer Salary UK](https://www.wearedevelopers.com/magazine/253-data-engineer-salary-uk) - [Best Companies to Work For in Paris: Top 25 Companies in 2023 ](https://www.wearedevelopers.com/magazine/190-best-companies-to-work-for-in-paris-top-25-companies-in-2023) - [The Most Popular IT Jobs on the Market](https://www.wearedevelopers.com/magazine/376-the-most-popular-it-jobs-on-the-market) - [Best Companies to Work For in France: Top 25 Companies in 2023 ](https://www.wearedevelopers.com/magazine/189-best-companies-to-work-for-in-france-top-25-companies-in-2023) - [Best Coding Boot Camps in Germany](https://www.wearedevelopers.com/magazine/237-best-coding-boot-camps-in-germany) - [How to Become an AI Engineer](https://www.wearedevelopers.com/magazine/331-how-to-become-an-ai-engineer)