Data Scientist / Data Engineer (h/f)

emagine Consulting SARL
Courbevoie, France
about 2 months ago

Role details

Contract type
Contract
Employment type
Full-time (> 32 hours)
Working hours
Regular working hours
Languages
English
Job source

Tech stack

Machine Learning Data Ingestion Apache Spark Web Content

Job description

Le consultant Data Scientist / Data Engineer aura pour mission de concevoir et optimiser des systèmes de machine learning pour le traitement et l’analyse de données à partir de sources multi-données., Exemple de tâches de travail

Construire des pipelines Spark pour récupérer du contenu web en utilisant des fine-tuned lightweight ML models.

Fine-tuner des modèles de ML à partir de modèles de base afin d?effectuer de l?extraction d?attributs spécifiques à une tâche ; construire des données d?entraînement, gérer la qualité des données et évaluer les performances de bout en bout ainsi qu?au niveau de chaque composant.

Étendre un agent de recherche IA interne à de nouveaux marchés géographiques, en adaptant la logique et en évaluant les performances selon les zones locales ; ajouter la prise en charge de nouveaux attributs liés aux lieux, incluant la collecte de preuves et des mécanismes de raisonnement.

Requirements

Excellentes compétences en Python, avec une maîtrise de Polars et/ou Pandas.

Expérience en traitement automatique du langage naturel (NLP) et en fine-tuning de modèles de machine learning légers.

Expérience en Scala et Apache Spark pour les parcours orientés Data Engineering.

Capacité à concevoir, développer et évaluer des pipelines de données.

Familiarité avec les frameworks d?agents IA, notamment LangGraph.

Capacité à adapter et évaluer des systèmes de machine learning sur différents contextes géographiques, linguistiques et domaines de données.

Expérience dans l?orchestration et l?optimisation de pipelines pour l?ingestion de données à grande échelle provenant de multiples sources.

Benefits & conditions

Courte mission (3 mois)

Démarrage ASAP, full sur site

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on indeed.com

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

2:34 min

Capabilities of the Apache Spark processing engine

Ayon Roy · LIVE

9:02 min

Building enduring web content against algorithmic search paywalls

Chris Heilmann +2 · LIVE

1:06 min

Ingesting streaming data securely with managed hubs

Eldert Grootenboer +1 · WWC 2023

3:14 min

Structuring career paths and localized data architectures

Ulrich Wurstbauer +1 · LIVE

2:56 min

Options for database machine learning integration architectures

Akmal Chaudhri Akmal Chaudhri · LIVE

2:16 min

Implementing content permissions for large language web crawlers

Farooq Sheikh Farooq Sheikh +3 · WWC 2025

Videos

See all

Related articles

See all