Consultant Llmops - Model Serving H/F
- Discuss this with your agent
- Open in Claude
- Open in ChatGPT
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Role details
Tech stack
Job description
Dans le cadre du développement d’un socle agentique destiné à industrialiser l’usage de modèles d’IA en production, une équipe recherche un consultant expérimenté en LLMOps / MLOps et Model Serving.
La mission consiste à mettre en place et faire évoluer les mécanismes permettant d’exposer les modèles aux agents IA dans un environnement de production maîtrisé, avec de fortes exigences en matière de performance, observabilité, sécurité, traçabilité et optimisation des coûts.
Le consultant intégrera une équipe dédiée au socle agentique, en interaction étroite avec les équipes de développement d’agents, les profils Data/IA, les équipes SRE et les équipes d’exploitation.
Missions
- Mise en place et évolution des services d’exposition et d’inférence des modèles.
- Conception des interfaces permettant aux agents IA d’accéder aux modèles.
- Gestion du versioning, du routage, des endpoints et des paramètres de génération.
- Définition et optimisation des quotas, timeouts et stratégies de fallback entre différents modèles.
- Contribution aux choix d’hébergement et de dimensionnement : GPU, Kubernetes, services managés ou déploiement interne.
- Mesure et optimisation de la latence, du débit, des taux d’erreur, de la consommation GPU et des coûts d’utilisation.
- Mise en place de mécanismes d’observabilité, de monitoring, de dashboards et d’alerting dédiés aux services modèles.
- Optimisation des paramètres d’inférence, de la mise en cache et, lorsque pertinent, des stratégies de batch.
- Mise en place des traces nécessaires au suivi de la qualité et aux arbitrages économiques.
- Traçabilité des versions de modèles utilisées par les agents.
- Contribution aux mécanismes de validation avant exposition d’un modèle à un cas d’usage.
- Définition et documentation des standards et procédures LLMOps, notamment en matière de changement, validation et rollback.
- Contribution à l’industrialisation et à l’automatisation des pratiques d’exploitation.
- Collaboration avec les équipes Data/IA, SRE, développement d’agents, architecture, sécurité et opérations.
- Participation aux instances de suivi et de pilotage ainsi qu’à la mise à jour des indicateurs d’avancement.
- Participation ponctuelle à des bascules de versions ou à des tests de charge nécessitant une disponibilité en horaires adaptés.
Livrables attendus
- Service d’exposition des modèles aux agents, versionné et documenté.
- Dashboards de suivi de la latence, des erreurs, de la consommation GPU et des coûts.
- Système d’alerting associé aux services modèles.
- Procédures de validation, changement et rollback.
- Documentation des standards et pratiques LLMOps à destination des équipes d’exploitation.
- Traces permettant les analyses de qualité et les arbitrages économiques.
- Mécanismes de traçabilité des versions de modèles utilisées par les agents.
- Tableaux de suivi et indicateurs de pilotage.
- Documentation technique et transfert de connaissances auprès des équipes.
Environnement technique
- LLMOps / MLOps
- Model Serving
- APIs d’inférence
- Kubernetes
- GPU
- Python et écosystème IA
- Registry et versioning de modèles
- Gouvernance des modèles
- Observabilité, monitoring et alerting
- Dashboards
- Déploiement applicatif
- Dimensionnement et optimisation des ressources
- Gestion des quotas et des coûts
- Sécurité des services IA
- Automatisation et pratiques d’exploitation
- Environnements de production critiques, Expérience requise : Plus de 7 ans
- Démarrage : ASAP
- Interventions ponctuelles : possibilité d’horaires adaptés lors des bascules de versions ou des tests de charge
Requirements
Profil recherchéExpérience significative en LLMOps ou MLOps dans des environnements de productionTrès bonne maîtrise du Model Serving et des APIs d’inférenceExpérience concrète de la gestion et de l’optimisation de ressources GPUMaîtrise de Kubernetes et du déploiement de services applicatifsCapacité à analyser et optimiser les performances : latence, débit, erreurs, consommation GPU et coûtsMaîtrise des problématiques d’observabilité appliquées aux services modèlesBonne maîtrise de Python et de l’écosystème IAExpérience en versioning, registry et gouvernance des modèlesBonne compréhension des problématiques de sécurité, quotas, coûts et contrôle des usagesExpérience dans la mise en oeuvre de mécanismes de routage, timeout et fallback entre modèlesCapacité à administrer des versions de modèles, endpoints et paramètres d’inférenceCapacité à participer à des choix d’architecture et d’hébergement de modèlesExpérience des environnements de production fortement industrialisés et automatisésCapacité à documenter les choix techniques et à transférer les bonnes pratiques aux équipesAisance dans la collaboration avec des équipes techniques variées : Data/IA, SRE, développement, architecture, sécurité et exploitation
Mais aussi…
Taux journalier :~600.css-11k7fwb{display:inline-block;white-space:nowrap;vertical-align:middle;-webkit-padding-start:var(–chakra-space-1-5);padding-inline-start:var(–chakra-space-1-5);-webkit-padding-end:var(–chakra-space-1-5);padding-inline-end:var(–chakra-space-1-5);text-transform:none;font-size:var(–chakra-fontSizes-xs);border-radius:var(–chakra-radii-md);font-weight:var(–chakra-fontWeights-semibold);background:var(–chakra-colors-success-200);color:var(–chakra-colors-success-700);box-shadow:var(–badge-shadow);padding:4px 6px;–badge-bg:var(–chakra-colors-success-100);–badge-color:colors.success.800;}.chakra-ui-dark .css-11k7fwb:not([data-theme]),[data-theme=dark] .css-11k7fwb:not([data-theme]),.css-11k7fwb[data-theme=dark]{–badge-bg:rgba(226, 243, 232, 0.16);–badge-color:var(–chakra-colors-success-200);}Cette offre est à 0% de commission .css-74lrwu{width:1em;height:1em;line-height:1em;-webkit-flex-shrink:0;-ms-flex-negative:0;flex-shrink:0;color:currentColor;font-size:16px;display:-webkit-box;display:-webkit-flex;display:-ms-flexbox;display:flex;-webkit-transition:.1s ease-in-out color;transition:.1s ease-in-out color;}.css-74lrwu *{-webkit-transition:.1s ease-in-out fill;transition:.1s ease-in-out fill;fill:var(–chakra-colors-rythm-600);}, 1. Expérience significative en LLMOps ou MLOps dans des environnements de production
- Très bonne maîtrise du Model Serving et des APIs d’inférence
- Expérience concrète de la gestion et de l’optimisation de ressources GPU
- Maîtrise de Kubernetes et du déploiement de services applicatifs
- Capacité à analyser et optimiser les performances : latence, débit, erreurs, consommation GPU et coûts
- Maîtrise des problématiques d’observabilité appliquées aux services modèles
- Bonne maîtrise de Python et de l’écosystème IA
- Expérience en versioning, registry et gouvernance des modèles
- Bonne compréhension des problématiques de sécurité, quotas, coûts et contrôle des usages
- Expérience dans la mise en oeuvre de mécanismes de routage, timeout et fallback entre modèles
- Capacité à administrer des versions de modèles, endpoints et paramètres d’inférence
- Capacité à participer à des choix d’architecture et d’hébergement de modèles
- Expérience des environnements de production fortement industrialisés et automatisés
- Capacité à documenter les choix techniques et à transférer les bonnes pratiques aux équipes
- Aisance dans la collaboration avec des équipes techniques variées : Data/IA, SRE, développement, architecture, sécurité et exploitation
EUR
Intelligence artificielle API Contrôle qualité Routage Création d’une base documentaire Batching Kubernetes Python Logiciels de gestion de versions Monitoring
Apply for this position
This job is hosted externally. Click below to view the full posting and apply.
Prepare application
- Draft this with your agent
- Open in Claude
- Open in ChatGPT
Good distractions
Loading talks and stories from around this role…