U-03Fiche projet

Prédiction d'usage mémoire

Machine learning en production sur pipelines bio-informatiques

Cadre
Sophia Genetics
Période
2025.04 → 2025.09
État
Livré

Contexte

Dans un pipeline bio-informatique, chaque tâche demande une allocation mémoire avant de démarrer. Surestimer coûte du cloud ; sous-estimer fait échouer la tâche et repartir de zéro. Le système prédit l'usage réel par tâche.

Contraintes

  • 01Se tromper vers le bas est plus cher que se tromper vers le haut : l'erreur n'est pas symétrique.
  • 02Le modèle sert en production, pas en notebook : il doit tenir dans une chaîne CI/CD.
  • 03Les données viennent de sources hétérogènes et ne sont pas propres.

Décisions techniques

  1. 01

    Ensembles d'arbres plutôt qu'un réseau

    XGBoost, LightGBM, CatBoost et Random Forest comparés : sur des données tabulaires hétérogènes, un ensemble d'arbres se règle plus vite, s'explique et ne demande pas de GPU en production.

  2. 02

    Chaîne ETL avant modèle

    Collecte, prétraitement et feature engineering en Python et Pandas, sur ElasticSearch et Azure Blob Storage. La qualité du jeu d'entraînement décide de tout le reste.

  3. 03

    Mise en production continue

    Déploiement par GitLab CI/CD, en méthode agile — le modèle vit avec le pipeline qu'il sert.

Résultat

Coûts cloud, taux d'échec et temps d'exécution en baisse sur le calcul distribué. Les valeurs chiffrées ne sont pas publiées ici.

Parc

  • Python
  • Pandas
  • XGBoost
  • LightGBM
  • CatBoost
  • Random Forest
  • ElasticSearch
  • Azure Blob Storage
  • GitLab CI/CD