Expert(e) IA / Data Scientist - Sécurisation SOC via LLM

HEXAGONE GROUPE
Toulouse, France
about 1 month ago

Role details

Contract type
Permanent contract
Employment type
Full-time (> 32 hours)
Experience level
Expert
Experience required
6 years minimum
Working hours
Regular working hours
Job source

Tech stack

Open Source Technology Reinforcement Learning Large Language Models

Job description

Le client intègre des technologies d’Intelligence Artificielle Générative au sein de son SOC afin d’automatiser l’analyse de menaces, de contextualiser les alertes de sécurité et d’assister les analystes.

L’objectif est de concevoir des modèles de langage (LLM/SLM) souverains et ultra-spécialisés en cybersécurité. Le/la consultant(e) travaillera en collaboration directe avec l’équipe R&D Cyber et l’équipe SOC, dans un environnement de recherche et développement agile.

Rôle et responsabilités principales

Fine-tuning de LLM open-source (Llama, Mistral, Qwen?) sur des données de cybersécurité (logs, rapports CTI, playbooks)

Mise en ?uvre de techniques d’apprentissage par renforcement pour limiter les hallucinations et sécuriser les réponses générées

Définition et application des formats de prompt et de conversation pour l’entraînement des modèles ? Structuration et formatage des datasets d’entraînement textuels

Mise en place de pipelines d’évaluation et de benchmarking pour mesurer la performance des modèles “Cyber” face aux standards du marché

Vulgarisation des concepts IA auprès de profils cybersécurité (analystes SOC, RSSI)

Collaboration directe avec l’équipe R&D Cyber et l’équipe SOC

Livrables attendus

Modèles LLM/SLM fine-tunés et spécialisés en cybersécurité

Datasets d’entraînement structurés et formatés (ChatML, Alpaca)

Pipelines d’évaluation et de benchmarking (interne et standards du marché)

Rapports de performance comparative des modèles

Requirements

Profil sénior (6 à 9 ans d’expérience), positionné auprès des Métiers, capable d’exploiter, analyser et évaluer des données structurées ou non pour établir des scénarios anticipant les leviers Métiers ou opérationnels. Autonomie attendue dans un environnement R&D agile.

Rigueur scientifique sur la qualité des données et la reproductibilité des benchmarks. Bonne capacité de communication et de vulgarisation auprès d’interlocuteurs non-IA.

Apply for this position

This job is hosted externally. Click below to view the full posting and apply.

Apply on fr.indeed.com

Good distractions

Talks and stories from around this role — technically off-topic, practically not.

3:32 min

Fundamentals and limitations of large language models

Krzystof Czieslak · LIVE

1:26 min

Selecting open source technologies for multi-cloud capability

Ingo Weichsel · World Congress 2023

1:45 min

Supervised, unsupervised, and reinforcement learning paradigms explained

Alexandra Waldherr · LIVE

1:34 min

Bringing diverse skills to industrial data science roles

Katja Träumner

2:25 min

Understanding the evolution and nature of large language models

Krzysztof Cieślak Krzysztof Cieślak · World Congress 2024

3:09 min

Balancing data science skillings alongside systems engineering rigor

Nico Schmidt · LIVE

Videos

See all

Related articles

See all