ASN Paris Les Ulis

Stage en Data Science et Machine Learning pour la supervision optique sous-marine F/H

ASN Paris Les Ulis Saint-Jean-de-Beauregard, Ile-de-France, France · €20K/yr

Telecommunications · 1,001-5,000 employees

23 h ago
machine-learning Junior (0-2 yrs) Full-time France
Create a free account to apply — email only, no card. You can also save this posting or score it against your profile with AI.

About the role

The intern will develop and validate robust machine learning models for underwater optical supervision, focusing on uncertainty quantification and model reliability. They will also manage the CI/CD pipeline, maintain the data simulator, and develop validation APIs to ensure seamless software integration.

What they look for

Data Science Machine Learning Python FastAPI Flask CI/CD DevOps Mathematical Modeling Uncertainty Quantification Bayesian Methods Software Integration Predictive Modeling Algorithm Optimization Technical Documentation Generative AI LLMs

Requirements

The candidate should have a strong background in data science, machine learning, and software engineering, with experience in Python and CI/CD tools. Proficiency in mathematical modeling and an interest in system architecture and generative AI are highly valued for this role.

Full description

Au sein de l'équipe System & Architecture, le stagiaire participera à l'évolution d'un système de supervision optique basé sur le Machine Learning. L'objectif est de passer de modèles de prédiction performants à des modèles robustes, dont on peut mesurer la fiabilité, et dont l'intégration logicielle est sécurisée.

Le stagiaire interviendra sur toute la chaîne : depuis l'amélioration du simulateur de données (générateur de scénarios), l'analyse mathématique des signatures de pannes, jusqu'à la mise en place d'une infrastructure de test (CI/CD) et d'une API de validation.

Ses missions principales seront les suivantes :

A. Analyse de l'incertitude et robustesse des modèles

  • Développer des méthodes pour mesurer l'incertitude des prédictions du modèle.
  • Mise en place d’une métrique quand le modèle "ne sait pas" ou lorsqu'il est confronté à des données nouvelles jamais vues durant l'apprentissage.
  • Identifier et analyser les combinaisons d'événements produisant des signatures identiques ou très proches (cas d'indéterminations) en utilisant des approches heuristiques ou méta-heuristiques.
  • Étudier l'impact de ces signatures proches sur la prise de décision pour éviter tout biais dans le diagnostic final.

B. Validation et analyse comparative

  • Conduire une analyse comparative entre les nouveaux modèles (incluant les nouveaux événements simulés) et les modèles précédemment validés.
  • Évaluer les performances sur des jeux de données de tests complexes et documenter les régressions ou améliorations.

C. Industrialisation, CI et Intégration logicielle

  • Remettre en état la chaîne d'Intégration Continue (CI) : correction des tests unitaires et d'intégration suite aux évolutions du simulateur.
  • Régénérer les fixtures de tests (mise à jour des formats de matrices et des données de référence).
  • Développer une API intermédiaire permettant de tester et valider les modèles en temps réel avant leur intégration finale dans le produit.
  • Assurer la livraison technique des modèles et rédiger la documentation d'interface pour les équipes de développement.

D. Amélioration et documentation du simulateur

  • Assurer la maintenance et l'optimisation du simulateur de pics de supervision pour garantir la qualité des données générées.
  • Concevoir une documentation technique approfondie et structurée du simulateur pour garantir la pérennité du savoir-faire.

E. Intelligence Artificielle Générative (optionnel)

  • Explorer et implémenter des cas d’usage basés sur les LLM pour optimiser les workflows internes (ex: automatisation de la génération de rapports techniques, aide à la rédaction de la documentation…).

Ce stage permettra d’acquérir une expérience pratique à l’intersection de la data science, de l’optimisation, de la modélisation de systèmes complexes et de l’automatisation de l’analyse des modèles et leur déploiement dans le produit final.

Tâches à réaliser pour l’ensemble des missions qui seront confiées :

A. Analyse de l'incertitude, robustesse et traitement des cas limites

  • Quantification de l'incertitude : Étudier et implémenter des méthodes de mesure de la confiance du modèle (ex: régression quantile, méthodes bayésiennes ou Dropout Monte Carlo) pour identifier les zones d'ombre du modèle.
  • Détection de données "hors distribution" (Out-of-Distribution) : Développer un indicateur permettant de signaler lorsque le modèle est confronté à une signature de panne qu'il n'a jamais rencontrée durant sa phase d'apprentissage.
  • Résolution des cas limites et indéterminations :
  • Analyser les scénarios de pannes complexes et atypiques (cas limites) où le modèle diverge ou produit des erreurs significatives.
  • Identifier et analyser les "cas d'école" : combinaisons d'événements différentes produisant une signature optique identique (collisions de signatures) via des approches heuristiques ou méta-heuristiques.
  • Proposer des solutions techniques pour lever ces ambiguïtés (enrichissement du dataset, modification des features proxy ou ajout de contraintes physiques).
  • Étude de biais et validation : Réaliser des tests comparatifs entre les nouveaux modèles et les versions validées pour s'assurer que la résolution d'un cas limite n'introduit pas de régression sur les cas standards.

B. Industrialisation et Ingénierie Logicielle (DevOps/CI)

  • Restauration de la chaîne CI/CD :
  • Diagnostiquer et corriger les tests unitaires et d'intégration devenus obsolètes suite aux évolutions du simulateur.
  • Mettre à jour et régénérer l'ensemble des fixtures de tests (mise en conformité avec les nouveaux formats de matrices et structures de données).
  • Développement d'une API de validation :
  • Concevoir et développer une API (type FastAPI ou Flask) permettant d'injecter des données de test et d'extraire les prédictions des modèles en temps réel.
  • Permettre l'évaluation rapide des modèles indépendamment du cycle de développement du produit final.
  • Documentation du cycle de vie du modèle :
  • Rédiger la spécification technique complète du pipeline de traitement :
  • Pré-processing : Détail des features proxy, étapes de nettoyage et protocoles de normalisation.
  • Inférence : Description de l'architecture du modèle, gestion des entrées/sorties et calcul des quantiles.
  • Post-processing : Algorithmes de reconstitution des valeurs physiques et logique de filtrage des résultats.
  • Définir le workflow de livraison des modèles (versioning, formats d'export) pour les équipes de développement.

C. Évolution et Ingénierie du Simulateur de Données

  • Maintenance et fiabilisation du simulateur :
  • Identifier et corriger les éventuelles anomalies de comportement ou régressions dans la génération des signatures de pics.
  • Documentation technique pour évolution future :
  • Concevoir un guide technique exhaustif du simulateur (non destiné à l'utilisateur final mais aux futurs développeurs/chercheurs).
  • Documenter les modèles théoriques et stochastiques implémentés, la structure du générateur de scénarii et la logique de conversion en pics de supervision.
  • L'objectif est de garantir que le simulateur puisse être évolué et maintenu sans régression lors de l'ajout de nouveaux composants réseaux.

D. Intelligence Artificielle Générative (optionnel)

  • Selon vos appétences et compétences, vous pourrez être amené à travailler sur des projets transverses visant à automatiser et optimiser des processus internes se basant sur de l'IA générative.

Similar roles