learn.chetana.fr

CI/CD de modèles, données versionnées, coûts GPU

13 min readCore

La CI/CD d'un projet ML : tes étapes + trois nouvelles

Une pipeline ML reprend ta CI classique (lint, tests unitaires, build) et ajoute :

  1. tests de données : les assertions de qualité (module 4) jouées sur un échantillon ;
  2. entraînement + évaluation automatisés : sur push vers main (dataset réduit pour la vitesse) puis entraînement complet planifié — le modèle candidat doit battre le champion sur le golden set pour être promu ;
  3. tests du service d'inférence : contrat d'API, latence sur données de référence, taille de l'image.

Le déclencheur est triple — et c'est LA nouveauté conceptuelle : un réentraînement part d'un changement de code, d'un changement de données (nouvelle version du dataset), ou d'une alerte de drift (module 8.3).

Versionner les données : DVC et les conventions

DVC applique la logique git aux datasets : le fichier .dvc (léger, commité) pointe vers le blob (object storage) par son hash. git checkout + dvc pull = le code ET les données de n'importe quel commit. Alternative pragmatique à grande échelle : des partitions immuables (dataset/v=2026-07-06/) — on n'écrase jamais, on ajoute des versions.

Les coûts GPU : l'éléphant dans la facture

Ordres de grandeur à connaître (2026) : un H100 loué ≈ 2-4 $/h ; un nœud de 8 ≈ 20-30 $/h — un entraînement qui traîne une semaine = des milliers d'euros. Les leviers du MLE, par rendement décroissant :

  1. Ne pas entraîner : un modèle plus petit, un fine-tuning LoRA au lieu d'un full, un boosting au lieu d'un réseau (module 5 !) ;
  2. Saturer : un GPU à 30 % coûte 100 % — profiler le data loading (souvent le vrai goulot), batcher juste ;
  3. Spot instances pour l'entraînement (avec checkpointing régulier pour survivre aux préemptions — l'idempotence, toujours) ;
  4. Inférence : quantization (module 1), autoscaling à zéro pour les charges creuses, cache des réponses fréquentes.

Le réflexe : le coût par entraînement et par 1000 prédictions sur le dashboard, à côté de la latence. Un modèle 1 % meilleur qui coûte 5× plus cher est presque toujours le mauvais choix — et c'est le MLE qui tient ce chiffre.

🧩 Quiz1/4

Quels sont les TROIS déclencheurs d'un réentraînement automatisé ?

🃏 Flashcards1/4