Cours 4 min·Data & IA

Comprendre le Machine Learning

Ce cours t'apprend ce qu'est le machine learning, comment il fonctionne et pourquoi il transforme tant de secteurs. Tu repartiras avec les bases pour comprendre les discussions techniques et éviter les pièges courants.

1.Qu'est-ce que le machine learning

Le machine learning, ou apprentissage automatique, est une méthode qui permet à un programme d'apprendre à partir de données, sans qu'on lui dicte explicitement toutes les règles. Au lieu d'écrire un code qui dit "si la température dépasse 30 degrés alors alerte", on montre au programme des milliers d'exemples de situations passées, et il découvre lui-même les régularités. Par exemple, une banque qui veut détecter des fraudes ne liste pas toutes les combinaisons possibles de fraude : elle donne à l'algorithme des milliers de transactions passées, étiquetées "fraude" ou "normale", et le système apprend à repérer les motifs suspects. Le machine learning est une branche de l'intelligence artificielle, ce domaine plus large qui vise à simuler des capacités cognitives humaines. Il sert aujourd'hui à recommander des films, traduire des textes, ou diagnostiquer des maladies.

  • Le ML apprend des règles à partir de données, pas d'instructions écrites à la main.
  • C'est une sous-partie de l'intelligence artificielle.
  • Exemple courant : détection de fraude bancaire à partir de transactions passées.

2.Les données, matière première du modèle

Un modèle de machine learning ne vaut que par les données qu'on lui donne. Une donnée est une information brute : l'âge d'un client, le prix d'une maison, la couleur d'une image en pixels. On organise ces données en exemples, chacun composé de variables d'entrée, appelées features, et parfois d'une réponse attendue, appelée étiquette ou label. Par exemple, pour prédire le prix d'un appartement, les features seraient la surface, le quartier, l'étage, et le label serait le prix réel observé. Plus les données sont nombreuses et représentatives, mieux le modèle apprend. Un modèle entraîné sur 100 exemples parisiens ne fonctionnera pas bien pour prédire des prix à Marseille, car il n'a jamais vu ce type de contexte. C'est pourquoi la qualité et la diversité des données comptent souvent plus que la sophistication de l'algorithme choisi.

  • Une feature est une variable d'entrée, un label est la réponse à prédire.
  • La qualité et la représentativité des données priment sur la complexité du modèle.
  • Exemple : prédire un prix immobilier avec surface, quartier et étage comme features.

3.Apprentissage supervisé et non supervisé

Il existe plusieurs façons d'apprendre. Dans l'apprentissage supervisé, chaque exemple d'entraînement possède un label connu : le modèle compare ses prédictions à la vraie réponse et ajuste ses paramètres pour réduire l'erreur. C'est le cas quand on entraîne un modèle à reconnaître des chats sur des photos déjà étiquetées "chat" ou "pas chat". Dans l'apprentissage non supervisé, il n'y a pas de label : le modèle cherche seul des structures cachées dans les données. Par exemple, un supermarché peut regrouper ses clients en familles selon leurs habitudes d'achat, sans savoir à l'avance combien de groupes existent ni ce qui les caractérise. Une troisième famille, l'apprentissage par renforcement, entraîne un agent à prendre des décisions en recevant des récompenses ou pénalités, comme un robot qui apprend à marcher en étant récompensé chaque fois qu'il avance sans tomber.

  • Supervisé : le modèle apprend avec des exemples déjà étiquetés.
  • Non supervisé : le modèle découvre des structures sans étiquettes fournies.
  • Renforcement : l'agent apprend par essais, récompenses et pénalités.

4.Entraîner un modèle, étape par étape

Entraîner un modèle, c'est ajuster ses paramètres internes pour qu'il fasse le moins d'erreurs possible sur les exemples fournis. On sépare généralement les données en trois lots : l'ensemble d'entraînement, sur lequel le modèle apprend ; l'ensemble de validation, pour régler certains choix appelés hyperparamètres, comme la vitesse d'apprentissage ; et l'ensemble de test, gardé de côté, qui sert à évaluer la performance finale sur des données jamais vues. Imagine un modèle qui prédit si un email est un spam : on l'entraîne sur 8000 emails, on ajuste ses réglages sur 1000 autres, puis on vérifie ses performances sur 1000 emails totalement nouveaux. Cette séparation évite de tromper l'évaluation avec des données déjà connues du modèle. Le processus d'ajustement utilise une fonction de perte, qui mesure l'écart entre prédiction et réalité, et un algorithme d'optimisation qui réduit progressivement cet écart.

  • Trois lots de données : entraînement, validation, test.
  • La fonction de perte mesure l'écart entre prédiction et vraie valeur.
  • Le test final se fait toujours sur des données jamais vues par le modèle.

5.Surapprentissage et généralisation du modèle

Un bon modèle doit généraliser, c'est-à-dire bien fonctionner sur des données nouvelles, pas seulement sur celles qu'il a mémorisées. Le surapprentissage, ou overfitting, survient quand le modèle colle trop précisément aux exemples d'entraînement, y compris à leur bruit et leurs particularités, et perd sa capacité à prédire correctement sur des cas inédits. Par exemple, un modèle qui prédit la réussite scolaire pourrait apprendre par cœur que "l'élève numéro 47 a réussi", une information inutile en dehors du jeu d'entraînement. À l'inverse, le sous-apprentissage, ou underfitting, se produit quand le modèle est trop simple pour capter les régularités importantes, comme prédire un prix immobilier uniquement avec la couleur de la porte d'entrée. On surveille cet équilibre en comparant les performances sur l'entraînement et sur la validation : un grand écart entre les deux signale souvent un surapprentissage.

  • Le surapprentissage mémorise le bruit au lieu d'apprendre les tendances utiles.
  • Le sous-apprentissage signifie un modèle trop simple pour la tâche.
  • Comparer performance sur entraînement et validation révèle ces déséquilibres.

6.Erreurs fréquentes et points d'examen

Une confusion classique consiste à croire que plus de données garantit toujours un meilleur modèle, alors que des données biaisées ou mal étiquetées peuvent aggraver les résultats. Une autre erreur fréquente est d'évaluer le modèle sur les mêmes données que l'entraînement, ce qui donne une fausse impression de performance excellente. On confond aussi souvent intelligence artificielle et machine learning, alors que le premier est un domaine large et le second une méthode parmi d'autres. À l'examen, on te demandera souvent de distinguer apprentissage supervisé et non supervisé à partir d'un exemple concret, d'expliquer pourquoi séparer entraînement et test, ou d'identifier un cas de surapprentissage dans un graphique montrant deux courbes qui divergent. Sache aussi définir précisément feature, label, fonction de perte, et donner un exemple pour chaque terme sans les confondre entre eux.

  • Ne jamais évaluer un modèle sur les données utilisées pour l'entraîner.
  • IA et machine learning ne sont pas synonymes : le second est une sous-partie du premier.
  • Savoir repérer un surapprentissage sur un graphique de courbes d'erreur.

À retenir

  • 1Le machine learning apprend des règles à partir de données plutôt que par programmation explicite.
  • 2La qualité et la diversité des données déterminent souvent plus la performance que l'algorithme choisi.
  • 3Il existe trois grandes familles d'apprentissage : supervisé, non supervisé et par renforcement.
  • 4Séparer entraînement, validation et test est indispensable pour évaluer honnêtement un modèle.
  • 5Le surapprentissage et le sous-apprentissage représentent les deux déséquilibres majeurs à surveiller.
Vérifier que c'est acquis

Dix questions sur ce sujet démarrent tout de suite, corrigées et expliquées.

Le mémo du sujet

L'essentiel en six phrases, à relire la veille.

Cours rédigé par intelligence artificielle et relu au fil des retours. Pour un examen officiel, garde tes cours et les textes en vigueur comme référence.

Comprendre le Machine Learning : le cours — Jukura