Revision sheet: Introduction aux Techniques de Machine Learning

Plan du Cours

  1. Structure et organisation du cours de Machine Learning
  2. Applications courantes du Machine Learning dans divers domaines
  3. Les quatre tùches typiques du Machine Learning : supervisé, non supervisé, renforcement et génération
  4. Formulation du problÚme de prédiction en apprentissage supervisé
  5. Mesures de performance des prédicteurs : pertes locales, risque, prédicteur de Bayes et métriques globales pour données déséquilibrées
  6. Apprentissage non supervisé : clustering et réduction de dimension
  7. Régression linéaire et régression logistique : formulation, avantages et limites
  8. Régression logistique : formulation, optimisation et propriétés

1. Structure et organisation du cours de Machine Learning

Notions clés & Définitions

  • Error : erreur qui rĂ©sulte de la diffĂ©rence entre la prĂ©diction d’un modĂšle et la valeur rĂ©elle, pouvant ĂȘtre dĂ©composĂ©e en erreur d’estimation et erreur d’approximation.

Points essentiels

  • Le cours comprend 10 confĂ©rences totalisant 15 heures, abordant divers thĂšmes liĂ©s au Machine Learning. La premiĂšre introduction pose le cadre gĂ©nĂ©ral, tandis que les confĂ©rences suivantes traitent des mĂ©thodes plug-in, de la sĂ©lection de modĂšle et de la pĂ©nalisation. La partie centrale est consacrĂ©e aux arbres de dĂ©cision et aux forĂȘts alĂ©atoires. La progression pĂ©dagogique inclut Ă©galement la minimisation du risque empirique, essentielle pour l’apprentissage supervisĂ©. Enfin, le cours couvre des techniques avancĂ©es telles que boosting, rĂ©seaux de neurones, transformers, ainsi que des enjeux liĂ©s Ă  l’intelligence artificielle gĂ©nĂ©rative et aux aspects Ă©thiques, notamment la vie privĂ©e, l’équitĂ© et la sĂ©curitĂ©.

À retenir

Le cours est structurĂ© pour faire progresser l’étudiant Ă  travers une diversitĂ© de sujets, depuis les bases jusqu’aux techniques avancĂ©es, tout en intĂ©grant des enjeux Ă©thiques pour une comprĂ©hension complĂšte du Machine Learning.

2. Applications courantes du Machine Learning dans divers domaines

Notions clés & Définitions

  • **Machine Learning is everywhere

  • Image** : Champ de l'informatique qui permet aux systĂšmes d'apprendre et de s'amĂ©liorer automatiquement Ă  partir de donnĂ©es, sans ĂȘtre explicitement programmĂ©s.

Points essentiels

  • Le Machine Learning est utilisĂ© dans la reconnaissance d'images, la recherche web, les recommandations, la publicitĂ©, le scoring, la segmentation de marchĂ©, la traduction, la reconnaissance vocale, les voitures autonomes, la santĂ© et l'intelligence artificielle gĂ©nĂ©rative.
  • Ces applications montrent la transversalitĂ© et l'impact du Machine Learning dans la vie quotidienne et l'industrie.

À retenir

Le Machine Learning est omniprésent, avec des applications concrÚtes qui démontrent son impact transversal dans de nombreux secteurs.

3. Les quatre tùches typiques du Machine Learning : supervisé, non supervisé, renforcement et génération

Notions clés & Définitions

  • SupervisĂ© : Apprentissage dans lequel les donnĂ©es d’entrĂ©e (Xi) sont associĂ©es Ă  des Ă©tiquettes (Yi), permettant de prĂ©dire ces Ă©tiquettes pour de nouvelles donnĂ©es non vues.

  • Data : Ensemble de donnĂ©es comprenant des Ă©lĂ©ments Xi appartenant Ă  un espace X, avec ou sans Ă©tiquettes Yi dans un espace Y.

  • Supervised Learning : Technique oĂč l’objectif est de prĂ©dire une Ă©tiquette Yi Ă  partir de donnĂ©es Xi Ă©tiquetĂ©es, en utilisant un modĂšle entraĂźnĂ© sur un jeu de donnĂ©es d’apprentissage.

  • **Learning

  • Data** : Processus d’apprentissage basĂ© sur des donnĂ©es, avec distinction entre donnĂ©es Ă©tiquetĂ©es (supervisĂ©) et non Ă©tiquetĂ©es (non supervisĂ©).

Points essentiels

  • L’apprentissage supervisĂ© consiste Ă  prĂ©dire des labels Ă  partir de donnĂ©es Ă©tiquetĂ©es, telles que la classification de chiffres, la reconnaissance vocale ou la publicitĂ© ciblĂ©e. Les donnĂ©es Xi sont accompagnĂ©es de labels Yi, et l’objectif est de prĂ©voir ces labels pour des donnĂ©es nouvelles ou non vues.

  • L’apprentissage non supervisĂ© vise Ă  dĂ©couvrir des structures dans des donnĂ©es sans Ă©tiquettes, comme la segmentation en petits groupes (clustering) ou la rĂ©duction de dimensionnalitĂ© pour reprĂ©senter un espace ambiant plus simple. Ici, les donnĂ©es Xi sont uniquement des vecteurs, sans labels associĂ©s.

  • L’apprentissage par renforcement implique une interaction avec un environnement, oĂč chaque action effectuĂ©e influence les observations futures. Il s’agit d’un processus oĂč l’agent apprend Ă  optimiser ses actions en fonction des retours qu’il reçoit.

  • L’intelligence artificielle gĂ©nĂ©rative consiste Ă  crĂ©er de nouvelles donnĂ©es qui ressemblent aux donnĂ©es d’origine, en utilisant un dataset d’entraĂźnement. Elle peut produire des images, du texte ou d’autres types de contenu, en imitant la distribution des donnĂ©es initiales.

À retenir

Les quatre grandes catégories de tùches en Machine Learning se différencient par la nature des données (étiquetées ou non) et par leurs objectifs (prédiction, découverte de structure, interaction ou création). Chacune répond à un besoin spécifique dans le traitement des données.

4. Formulation du problÚme de prédiction en apprentissage supervisé

Notions clés & Définitions

  • Attributes/Features” space : espace de reprĂ©sentation des caractĂ©ristiques ou attributs d’une donnĂ©e, gĂ©nĂ©ralement notĂ© X, qui appartient Ă  un sous-ensemble de ℝ^d, oĂč d dĂ©signe la dimension de cet espace.

  • label” space : espace des Ă©tiquettes ou rĂ©sultats possibles, notĂ© Y, qui peut ĂȘtre discret (classifieur) ou continu (rĂ©gressseur).

  • space X ⊂ ℝ^d & ”label” space : indication que l’espace des attributs X est un sous-ensemble de ℝ^d et que l’espace des labels Y est dĂ©fini en fonction du type de problĂšme (discret ou continu).

Points essentiels

  • Les donnĂ©es d'entrĂ©e sont des couples (Xi, Yi) i.i.d. issus d’une loi inconnue sur X × Y, ce qui signifie que chaque paire est indĂ©pendante et identiquement distribuĂ©e selon une loi conjointe P.

  • L’objectif est de prĂ©dire le label Yn+1 associĂ© Ă  une nouvelle donnĂ©e Xn+1, Ă  partir du jeu d’entraĂźnement Dn composĂ© de couples (Xi, Yi).

  • Un prĂ©dicteur est une fonction f : X → Y, qui peut ĂȘtre un classifieur si Y est discret ou un rĂ©gressseur si Y est continu, permettant d’estimer le label Ă  partir des attributs.

À retenir

La modĂ©lisation mathĂ©matique du problĂšme de prĂ©diction supervisĂ©e consiste Ă  utiliser un jeu de donnĂ©es d’entraĂźnement pour apprendre une fonction capable de prĂ©voir le label d’une nouvelle donnĂ©e, en se basant sur la distribution inconnue des couples attributs-labels.

5. Mesures de performance des prédicteurs : pertes locales, risque, prédicteur de Bayes et métriques globales pour données déséquilibrées

Notions clés & Définitions

  • Arg minf R(f) et R∗ : dans le contexte de la performance d’un prĂ©dicteur, le risque R(f) est une mesure de la performance basĂ©e sur une fonction de perte locale ℓ. Le prĂ©dicteur de Bayes est celui qui minimise ce risque, avec R∗ reprĂ©sentant le risque minimal atteignable. Le prĂ©dicteur optimal f∗ est dĂ©fini comme celui qui minimise le risque attendu, et R∗ comme le risque associĂ© Ă  ce prĂ©dicteur.

  • Bayes predictor : prĂ©dicteur qui, pour chaque entrĂ©e X, choisit la sortie Y selon la rĂšgle qui minimise le risque attendu conditionnel, c’est-Ă -dire qu’il prĂ©dit la valeur qui minimise la perte locale ℓ en moyenne, compte tenu de la distribution conditionnelle P(Y|X).

Points essentiels

  • La performance d’un prĂ©dicteur est Ă©valuĂ©e par un risque attendu basĂ© sur une fonction de perte locale adaptĂ©e au problĂšme. Par exemple, la perte 0-1 est utilisĂ©e en classification, la perte quadratique en rĂ©gression linĂ©aire, et la log-loss en classification logistique. Ce risque R(f) correspond Ă  l’espĂ©rance du coĂ»t de prĂ©diction erronĂ©e ou approximative, calculĂ©e sur la distribution P(X, Y).

  • Le prĂ©dicteur de Bayes minimise ce risque, constituant ainsi la rĂ©fĂ©rence optimale en termes de performance. La rĂšgle de Bayes pour la classification consiste Ă  prĂ©dire la classe dont la probabilitĂ© conditionnelle est la plus Ă©levĂ©e, ce qui correspond Ă  la minimisation du risque de classification.

  • Le risque R(f) ne peut pas ĂȘtre Ă©valuĂ© directement dans la pratique, car la distribution P est inconnue. On utilise alors un jeu de test indĂ©pendant pour estimer la performance, en calculant une moyenne empirique de la perte sur cet ensemble, grĂące Ă  la loi des grands nombres.

  • Pour les donnĂ©es dĂ©sĂ©quilibrĂ©es, oĂč une classe est surreprĂ©sentĂ©e, des mĂ©triques globales comme la prĂ©cision, le rappel, le F1 score ou l’aire sous la courbe ROC sont privilĂ©giĂ©es. Ces indicateurs permettent une Ă©valuation plus fine de la performance en tenant compte des classes minoritaires ou des coĂ»ts diffĂ©rents liĂ©s aux erreurs.

À retenir

MaĂźtriser la mesure du risque basĂ© sur des pertes locales et comprendre le rĂŽle du prĂ©dicteur de Bayes permettent d’évaluer la performance optimale d’un modĂšle. En pratique, l’utilisation de mĂ©triques globales adaptĂ©es aux dĂ©sĂ©quilibres des donnĂ©es est essentielle pour une Ă©valuation fiable.

6. Apprentissage non supervisé : clustering et réduction de dimension

Notions clés & Définitions

  • Clustering : mĂ©thode qui consiste Ă  regrouper un ensemble de donnĂ©es dans un nombre fixe de groupes, appelĂ©s clusters, en maximisant la similaritĂ© Ă  l’intĂ©rieur de chaque groupe et en minimisant la similaritĂ© entre groupes. La qualitĂ© du clustering dĂ©pend du choix du nombre de clusters, souvent notĂ© k.

  • Dimension » reprĂ©sentation de Dn : projection ou transformation des donnĂ©es dans un espace de dimension infĂ©rieure, permettant de conserver la structure essentielle tout en simplifiant l’analyse. La rĂ©duction de dimension vise Ă  rĂ©duire la complexitĂ© tout en prĂ©servant les relations pertinentes entre les points.

Points essentiels

  • Le clustering regroupe les donnĂ©es en k groupes distincts, en cherchant Ă  maximiser la cohĂ©rence interne Ă  chaque cluster, souvent mesurĂ©e par une faible similaritĂ© intra-cluster, par exemple la distance moyenne entre points d’un mĂȘme groupe. La sĂ©paration entre clusters est favorisĂ©e par une grande similaritĂ© inter-cluster, c’est-Ă -dire une distance moyenne Ă©levĂ©e entre points de groupes diffĂ©rents.

  • La rĂ©duction de dimension projette les donnĂ©es dans un espace de dimension infĂ©rieure, notĂ©e d, en conservant la structure pertinente. Le choix de d est crucial : une dimension trop faible peut perdre des informations importantes, tandis qu’une dimension trop Ă©levĂ©e ne simplifie pas suffisamment la reprĂ©sentation.

  • Le choix du nombre de clusters k et de la dimension rĂ©duite d est souvent guidĂ© par des mĂ©triques spĂ©cifiques, permettant d’évaluer la qualitĂ© de la segmentation ou de la projection. Parmi ces mĂ©triques, on trouve la recherche d’une faible similaritĂ© intra-cluster et d’une grande distance inter-cluster.

  • Les donnĂ©es non Ă©tiquetĂ©es peuvent ne pas ĂȘtre indĂ©pendantes et identiquement distribuĂ©es (non i.i.d.), ce qui complique leur analyse et la dĂ©termination optimale du nombre de clusters ou de la dimension de projection.

À retenir

L’objectif de ces mĂ©thodes est d’extraire des structures significatives et de simplifier la reprĂ©sentation des donnĂ©es sans supervision, en utilisant des techniques de regroupement ou de projection adaptĂ©es.

7. Régression linéaire et régression logistique : formulation, avantages et limites

Notions clés & Définitions

  • Linear Regression : Une mĂ©thode de modĂ©lisation statistique qui Ă©tablit une relation linĂ©aire entre des variables explicatives et une variable continue, avec une solution analytique en forme fermĂ©e obtenue par minimisation de l'erreur quadratique.

Points essentiels

  • La rĂ©gression linĂ©aire est simple, intuitive et efficace pour les variables continues mais non adaptĂ©e aux variables binaires.
  • La rĂ©gression linĂ©aire modĂ©lise une relation linĂ©aire entre les variables explicatives et une variable continue avec une solution en forme fermĂ©e.

À retenir

Les modÚles linéaires se distinguent par leur formulation, leur utilité et leurs contraintes : la régression linéaire convient aux variables continues avec une solution analytique, tandis que la régression logistique est adaptée aux variables binaires et requiert une optimisation numérique.

8. Régression logistique : formulation, optimisation et propriétés

Notions clés & Définitions

  • Fonction de log-vraisemblance : fonction qui, pour un ensemble de donnĂ©es, consiste en une somme de termes log(1 + exp(-yÎČ⊀x)), oĂč y reprĂ©sente la variable cible et ÎČ le vecteur de paramĂštres. Elle est caractĂ©risĂ©e par sa convexitĂ© et sa diffĂ©rentiabilitĂ©, ce qui facilite son optimisation numĂ©rique.

  • Gradient de la log-vraisemblance : vecteur de dĂ©rivĂ©es partielles de la fonction de log-vraisemblance par rapport Ă  chaque composante de ÎČ. Il peut ĂȘtre estimĂ© de maniĂšre non biaisĂ©e par Ă©chantillonnage stochastique, permettant une mise Ă  jour efficace lors de l’optimisation.

  • Optimisation convexe : processus de recherche du minimum global d’une fonction convexe, ici la log-vraisemblance. La convexitĂ© assure que toute mĂ©thode numĂ©rique, comme la descente de gradient, converge vers une solution optimale sans se heurter Ă  des minima locaux.

Points essentiels

  • La fonction de log-vraisemblance en rĂ©gression logistique est une somme de termes log(1 + exp(-yÎČ⊀x)), oĂč y est transformĂ© en ˜Y = 2Y - 1. Elle est convexe et diffĂ©rentiable, ce qui facilite son optimisation. Le gradient de cette fonction peut ĂȘtre estimĂ© de maniĂšre non biaisĂ©e par Ă©chantillonnage stochastique, permettant d’adapter efficacement la mise Ă  jour des paramĂštres lors de l’apprentissage. L’optimisation de cette fonction se rĂ©alise via des mĂ©thodes numĂ©riques, comme la descente de gradient, car aucune solution analytique fermĂ©e n’existe. La fonction de perte logistique, substitut convexe et lisse Ă  la perte 0-1, facilite l’optimisation tout en offrant de bonnes performances pratiques.

À retenir

La log-vraisemblance en régression logistique, convexe et différentiable, permet une optimisation efficace par des méthodes numériques, rendant cette approche à la fois robuste et pratique pour la classification binaire.

Tableaux de SynthĂšse

Comparaison des tĂąches en Machine Learning

TypeObjectifDonnéesExemples
SupervisĂ©PrĂ©diction d’étiquettesDonnĂ©es Ă©tiquetĂ©esClassification
Non superviséDécouverte de structuresDonnées non étiquetéesClustering
RenforcementOptimisation d’actionsInteraction avec environnementApprentissage par essais et erreurs
GĂ©nĂ©rationCrĂ©ation de nouvelles donnĂ©esDonnĂ©es d’entraĂźnementGĂ©nĂ©ration d’images, texte

PiÚges & Confusions Fréquentes

  1. Confusion entre erreur d’estimation et erreur d’approximation dans la dĂ©finition de l’erreur.
  2. MĂ©langer les techniques de supervision et non supervision lors de l’interprĂ©tation des mĂ©thodes.
  3. Confusion entre risque empirique et risque vrai dans l’évaluation des modĂšles.
  4. Oublier la distinction entre mĂ©triques globales et locales pour l’évaluation.
  5. Confusion entre la modĂ©lisation mathĂ©matique et la pratique de l’optimisation.
  6. Sous-estimer l’impact des donnĂ©es dĂ©sĂ©quilibrĂ©es sur la performance.
  7. Confondre clustering et classification dans leur objectif et méthode.

Checklist Examen

  1. Comprendre la différence entre apprentissage supervisé et non supervisé.
  2. Savoir formuler un problÚme de prédiction en apprentissage supervisé.
  3. Connaßtre les mesures de performance des prédicteurs.
  4. Maßtriser les techniques de clustering et réduction de dimension.
  5. Comprendre la formulation et l’optimisation de la rĂ©gression logistique.
  6. Différencier risque, perte locale et métriques globales.
  7. Identifier les applications courantes du Machine Learning.
  8. Reconnaßtre les enjeux éthiques liés au Machine Learning.

Test your knowledge

Test your knowledge on Introduction aux Techniques de Machine Learning with 8 multiple-choice questions with detailed corrections.

1. Quelle étape est essentielle pour l'apprentissage supervisé selon la structure du cours ?

2. Comment le Machine Learning peut-il ĂȘtre appliquĂ© dans le domaine de la santĂ© ?

Take the quiz →

Review with flashcards

Memorize the key concepts of Introduction aux Techniques de Machine Learning with 16 interactive flashcards.

Erreur — dĂ©finition ?

Différence entre prédiction et valeur réelle.

Applications ML — exemples ?

Reconnaissance d'images, voitures autonomes, santé.

TĂąche supervisĂ©e — rĂŽle ?

Prédire étiquettes à partir de données étiquetées.

See flashcards →

Similar courses

Create your own revision sheets

Import your course and AI generates sheets, quizzes and flashcards in 30 seconds.

Sheet generator