Le cours est structurĂ© pour faire progresser lâĂ©tudiant Ă travers une diversitĂ© de sujets, depuis les bases jusquâaux techniques avancĂ©es, tout en intĂ©grant des enjeux Ă©thiques pour une comprĂ©hension complĂšte du Machine Learning.
**Machine Learning is everywhere
Image** : Champ de l'informatique qui permet aux systĂšmes d'apprendre et de s'amĂ©liorer automatiquement Ă partir de donnĂ©es, sans ĂȘtre explicitement programmĂ©s.
Le Machine Learning est omniprésent, avec des applications concrÚtes qui démontrent son impact transversal dans de nombreux secteurs.
SupervisĂ© : Apprentissage dans lequel les donnĂ©es dâentrĂ©e (Xi) sont associĂ©es Ă des Ă©tiquettes (Yi), permettant de prĂ©dire ces Ă©tiquettes pour de nouvelles donnĂ©es non vues.
Data : Ensemble de données comprenant des éléments Xi appartenant à un espace X, avec ou sans étiquettes Yi dans un espace Y.
Supervised Learning : Technique oĂč lâobjectif est de prĂ©dire une Ă©tiquette Yi Ă partir de donnĂ©es Xi Ă©tiquetĂ©es, en utilisant un modĂšle entraĂźnĂ© sur un jeu de donnĂ©es dâapprentissage.
**Learning
Data** : Processus dâapprentissage basĂ© sur des donnĂ©es, avec distinction entre donnĂ©es Ă©tiquetĂ©es (supervisĂ©) et non Ă©tiquetĂ©es (non supervisĂ©).
Lâapprentissage supervisĂ© consiste Ă prĂ©dire des labels Ă partir de donnĂ©es Ă©tiquetĂ©es, telles que la classification de chiffres, la reconnaissance vocale ou la publicitĂ© ciblĂ©e. Les donnĂ©es Xi sont accompagnĂ©es de labels Yi, et lâobjectif est de prĂ©voir ces labels pour des donnĂ©es nouvelles ou non vues.
Lâapprentissage non supervisĂ© vise Ă dĂ©couvrir des structures dans des donnĂ©es sans Ă©tiquettes, comme la segmentation en petits groupes (clustering) ou la rĂ©duction de dimensionnalitĂ© pour reprĂ©senter un espace ambiant plus simple. Ici, les donnĂ©es Xi sont uniquement des vecteurs, sans labels associĂ©s.
Lâapprentissage par renforcement implique une interaction avec un environnement, oĂč chaque action effectuĂ©e influence les observations futures. Il sâagit dâun processus oĂč lâagent apprend Ă optimiser ses actions en fonction des retours quâil reçoit.
Lâintelligence artificielle gĂ©nĂ©rative consiste Ă crĂ©er de nouvelles donnĂ©es qui ressemblent aux donnĂ©es dâorigine, en utilisant un dataset dâentraĂźnement. Elle peut produire des images, du texte ou dâautres types de contenu, en imitant la distribution des donnĂ©es initiales.
Les quatre grandes catégories de tùches en Machine Learning se différencient par la nature des données (étiquetées ou non) et par leurs objectifs (prédiction, découverte de structure, interaction ou création). Chacune répond à un besoin spécifique dans le traitement des données.
Attributes/Featuresâ space : espace de reprĂ©sentation des caractĂ©ristiques ou attributs dâune donnĂ©e, gĂ©nĂ©ralement notĂ© X, qui appartient Ă un sous-ensemble de â^d, oĂč d dĂ©signe la dimension de cet espace.
labelâ space : espace des Ă©tiquettes ou rĂ©sultats possibles, notĂ© Y, qui peut ĂȘtre discret (classifieur) ou continu (rĂ©gressseur).
space X â â^d & âlabelâ space : indication que lâespace des attributs X est un sous-ensemble de â^d et que lâespace des labels Y est dĂ©fini en fonction du type de problĂšme (discret ou continu).
Les donnĂ©es d'entrĂ©e sont des couples (Xi, Yi) i.i.d. issus dâune loi inconnue sur X Ă Y, ce qui signifie que chaque paire est indĂ©pendante et identiquement distribuĂ©e selon une loi conjointe P.
Lâobjectif est de prĂ©dire le label Yn+1 associĂ© Ă une nouvelle donnĂ©e Xn+1, Ă partir du jeu dâentraĂźnement Dn composĂ© de couples (Xi, Yi).
Un prĂ©dicteur est une fonction f : X â Y, qui peut ĂȘtre un classifieur si Y est discret ou un rĂ©gressseur si Y est continu, permettant dâestimer le label Ă partir des attributs.
La modĂ©lisation mathĂ©matique du problĂšme de prĂ©diction supervisĂ©e consiste Ă utiliser un jeu de donnĂ©es dâentraĂźnement pour apprendre une fonction capable de prĂ©voir le label dâune nouvelle donnĂ©e, en se basant sur la distribution inconnue des couples attributs-labels.
Arg minf R(f) et Râ : dans le contexte de la performance dâun prĂ©dicteur, le risque R(f) est une mesure de la performance basĂ©e sur une fonction de perte locale â. Le prĂ©dicteur de Bayes est celui qui minimise ce risque, avec Râ reprĂ©sentant le risque minimal atteignable. Le prĂ©dicteur optimal fâ est dĂ©fini comme celui qui minimise le risque attendu, et Râ comme le risque associĂ© Ă ce prĂ©dicteur.
Bayes predictor : prĂ©dicteur qui, pour chaque entrĂ©e X, choisit la sortie Y selon la rĂšgle qui minimise le risque attendu conditionnel, câest-Ă -dire quâil prĂ©dit la valeur qui minimise la perte locale â en moyenne, compte tenu de la distribution conditionnelle P(Y|X).
La performance dâun prĂ©dicteur est Ă©valuĂ©e par un risque attendu basĂ© sur une fonction de perte locale adaptĂ©e au problĂšme. Par exemple, la perte 0-1 est utilisĂ©e en classification, la perte quadratique en rĂ©gression linĂ©aire, et la log-loss en classification logistique. Ce risque R(f) correspond Ă lâespĂ©rance du coĂ»t de prĂ©diction erronĂ©e ou approximative, calculĂ©e sur la distribution P(X, Y).
Le prédicteur de Bayes minimise ce risque, constituant ainsi la référence optimale en termes de performance. La rÚgle de Bayes pour la classification consiste à prédire la classe dont la probabilité conditionnelle est la plus élevée, ce qui correspond à la minimisation du risque de classification.
Le risque R(f) ne peut pas ĂȘtre Ă©valuĂ© directement dans la pratique, car la distribution P est inconnue. On utilise alors un jeu de test indĂ©pendant pour estimer la performance, en calculant une moyenne empirique de la perte sur cet ensemble, grĂące Ă la loi des grands nombres.
Pour les donnĂ©es dĂ©sĂ©quilibrĂ©es, oĂč une classe est surreprĂ©sentĂ©e, des mĂ©triques globales comme la prĂ©cision, le rappel, le F1 score ou lâaire sous la courbe ROC sont privilĂ©giĂ©es. Ces indicateurs permettent une Ă©valuation plus fine de la performance en tenant compte des classes minoritaires ou des coĂ»ts diffĂ©rents liĂ©s aux erreurs.
MaĂźtriser la mesure du risque basĂ© sur des pertes locales et comprendre le rĂŽle du prĂ©dicteur de Bayes permettent dâĂ©valuer la performance optimale dâun modĂšle. En pratique, lâutilisation de mĂ©triques globales adaptĂ©es aux dĂ©sĂ©quilibres des donnĂ©es est essentielle pour une Ă©valuation fiable.
Clustering : mĂ©thode qui consiste Ă regrouper un ensemble de donnĂ©es dans un nombre fixe de groupes, appelĂ©s clusters, en maximisant la similaritĂ© Ă lâintĂ©rieur de chaque groupe et en minimisant la similaritĂ© entre groupes. La qualitĂ© du clustering dĂ©pend du choix du nombre de clusters, souvent notĂ© k.
Dimension » reprĂ©sentation de Dn : projection ou transformation des donnĂ©es dans un espace de dimension infĂ©rieure, permettant de conserver la structure essentielle tout en simplifiant lâanalyse. La rĂ©duction de dimension vise Ă rĂ©duire la complexitĂ© tout en prĂ©servant les relations pertinentes entre les points.
Le clustering regroupe les donnĂ©es en k groupes distincts, en cherchant Ă maximiser la cohĂ©rence interne Ă chaque cluster, souvent mesurĂ©e par une faible similaritĂ© intra-cluster, par exemple la distance moyenne entre points dâun mĂȘme groupe. La sĂ©paration entre clusters est favorisĂ©e par une grande similaritĂ© inter-cluster, câest-Ă -dire une distance moyenne Ă©levĂ©e entre points de groupes diffĂ©rents.
La rĂ©duction de dimension projette les donnĂ©es dans un espace de dimension infĂ©rieure, notĂ©e d, en conservant la structure pertinente. Le choix de d est crucial : une dimension trop faible peut perdre des informations importantes, tandis quâune dimension trop Ă©levĂ©e ne simplifie pas suffisamment la reprĂ©sentation.
Le choix du nombre de clusters k et de la dimension rĂ©duite d est souvent guidĂ© par des mĂ©triques spĂ©cifiques, permettant dâĂ©valuer la qualitĂ© de la segmentation ou de la projection. Parmi ces mĂ©triques, on trouve la recherche dâune faible similaritĂ© intra-cluster et dâune grande distance inter-cluster.
Les donnĂ©es non Ă©tiquetĂ©es peuvent ne pas ĂȘtre indĂ©pendantes et identiquement distribuĂ©es (non i.i.d.), ce qui complique leur analyse et la dĂ©termination optimale du nombre de clusters ou de la dimension de projection.
Lâobjectif de ces mĂ©thodes est dâextraire des structures significatives et de simplifier la reprĂ©sentation des donnĂ©es sans supervision, en utilisant des techniques de regroupement ou de projection adaptĂ©es.
Les modÚles linéaires se distinguent par leur formulation, leur utilité et leurs contraintes : la régression linéaire convient aux variables continues avec une solution analytique, tandis que la régression logistique est adaptée aux variables binaires et requiert une optimisation numérique.
Fonction de log-vraisemblance : fonction qui, pour un ensemble de donnĂ©es, consiste en une somme de termes log(1 + exp(-yÎČâ€x)), oĂč y reprĂ©sente la variable cible et ÎČ le vecteur de paramĂštres. Elle est caractĂ©risĂ©e par sa convexitĂ© et sa diffĂ©rentiabilitĂ©, ce qui facilite son optimisation numĂ©rique.
Gradient de la log-vraisemblance : vecteur de dĂ©rivĂ©es partielles de la fonction de log-vraisemblance par rapport Ă chaque composante de ÎČ. Il peut ĂȘtre estimĂ© de maniĂšre non biaisĂ©e par Ă©chantillonnage stochastique, permettant une mise Ă jour efficace lors de lâoptimisation.
Optimisation convexe : processus de recherche du minimum global dâune fonction convexe, ici la log-vraisemblance. La convexitĂ© assure que toute mĂ©thode numĂ©rique, comme la descente de gradient, converge vers une solution optimale sans se heurter Ă des minima locaux.
La log-vraisemblance en régression logistique, convexe et différentiable, permet une optimisation efficace par des méthodes numériques, rendant cette approche à la fois robuste et pratique pour la classification binaire.
Comparaison des tĂąches en Machine Learning
| Type | Objectif | Données | Exemples |
|---|---|---|---|
| SupervisĂ© | PrĂ©diction dâĂ©tiquettes | DonnĂ©es Ă©tiquetĂ©es | Classification |
| Non supervisé | Découverte de structures | Données non étiquetées | Clustering |
| Renforcement | Optimisation dâactions | Interaction avec environnement | Apprentissage par essais et erreurs |
| GĂ©nĂ©ration | CrĂ©ation de nouvelles donnĂ©es | DonnĂ©es dâentraĂźnement | GĂ©nĂ©ration dâimages, texte |
Test your knowledge on Introduction aux Techniques de Machine Learning with 8 multiple-choice questions with detailed corrections.
1. Quelle étape est essentielle pour l'apprentissage supervisé selon la structure du cours ?
2. Comment le Machine Learning peut-il ĂȘtre appliquĂ© dans le domaine de la santĂ© ?
Memorize the key concepts of Introduction aux Techniques de Machine Learning with 16 interactive flashcards.
Erreur â dĂ©finition ?
Différence entre prédiction et valeur réelle.
Applications ML â exemples ?
Reconnaissance d'images, voitures autonomes, santé.
TĂąche supervisĂ©e â rĂŽle ?
Prédire étiquettes à partir de données étiquetées.
Import your course and AI generates sheets, quizzes and flashcards in 30 seconds.
Sheet generator