U-03Fiche projet
Prédiction d'usage mémoire
メモリ予測
Machine learning en production sur pipelines bio-informatiques
Contexte
Dans un pipeline bio-informatique, chaque tâche demande une allocation mémoire avant de démarrer. Surestimer coûte du cloud ; sous-estimer fait échouer la tâche et repartir de zéro. Le système prédit l'usage réel par tâche.
Contraintes
- 01Se tromper vers le bas est plus cher que se tromper vers le haut : l'erreur n'est pas symétrique.
- 02Le modèle sert en production, pas en notebook : il doit tenir dans une chaîne CI/CD.
- 03Les données viennent de sources hétérogènes et ne sont pas propres.
Décisions techniques
- 01
Ensembles d'arbres plutôt qu'un réseau
XGBoost, LightGBM, CatBoost et Random Forest comparés : sur des données tabulaires hétérogènes, un ensemble d'arbres se règle plus vite, s'explique et ne demande pas de GPU en production.
- 02
Chaîne ETL avant modèle
Collecte, prétraitement et feature engineering en Python et Pandas, sur ElasticSearch et Azure Blob Storage. La qualité du jeu d'entraînement décide de tout le reste.
- 03
Mise en production continue
Déploiement par GitLab CI/CD, en méthode agile — le modèle vit avec le pipeline qu'il sert.
Résultat
Coûts cloud, taux d'échec et temps d'exécution en baisse sur le calcul distribué. Les valeurs chiffrées ne sont pas publiées ici.
Parc
- Python
- Pandas
- XGBoost
- LightGBM
- CatBoost
- Random Forest
- ElasticSearch
- Azure Blob Storage
- GitLab CI/CD