Blame

e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
1
# 1. Rappels mathématiques
2
3
Ce module rassemble les outils mathématiques sur lesquels s'appuie le reste du cours : un peu d'algèbre linéaire, le langage de l'espérance et de la covariance, la gaussienne multivariée, et les quatre quantités probabilistes (vraisemblance, a priori, a posteriori, évidence) que le module suivant transforme en une manière de raisonner. C'est une référence à consulter, pas un traitement complet.
4
5
## 1.1 Algèbre linéaire
6
7
Un vecteur de caractéristiques vit dans $\mathbb{R}^n$ et un jeu de données empile de tels vecteurs dans une matrice. Le produit scalaire de deux vecteurs somme leurs produits terme à terme :
8
9
$$\boxed{ x^T y = \sum_{i=1}^{n} x_i\, y_i }$$
10
11
Une matrice $A$ transforme un vecteur par le produit matrice-vecteur $Ax$, la transposée $A^T$ échange lignes et colonnes, et l'inverse $A^{-1}$ (quand elle existe) annule $A$, donc $A^{-1}A = I$. La norme euclidienne mesure la longueur :
12
13
$$\boxed{ \lVert x \rVert_2 = \sqrt{x^T x} }$$
14
15
Une matrice carrée est symétrique si $A = A^T$, et semi-définie positive si $x^T A x \ge 0$ pour tout $x$. Les matrices de covariance, qui apparaissent juste après, sont toujours symétriques et semi-définies positives.
16
17
## 1.2 Espérance et variance
18
19
L'espérance est la moyenne pondérée par les probabilités d'une variable aléatoire, une somme dans le cas discret et une intégrale dans le cas continu :
20
21
$$\boxed{ \mathbb{E}[X] = \sum_x x\, p(x) \qquad \mathbb{E}[X] = \int x\, p(x)\, dx }$$
22
23
L'espérance est linéaire, $\mathbb{E}[aX + b] = a\,\mathbb{E}[X] + b$. La variance mesure la dispersion autour de la moyenne $\mu = \mathbb{E}[X]$ :
24
25
$$\boxed{ \mathrm{Var}(X) = \mathbb{E}\!\left[(X - \mu)^2\right] = \mathbb{E}[X^2] - \mu^2 }$$
26
27
## 1.3 Covariance et matrice de covariance
28
29
La covariance mesure comment deux variables évoluent ensemble :
30
31
$$\boxed{ \mathrm{Cov}(X, Y) = \mathbb{E}\!\left[(X - \mu_X)(Y - \mu_Y)\right] }$$
32
33
Pour un vecteur aléatoire $x \in \mathbb{R}^n$ de moyenne $\mu$, la matrice de covariance rassemble toutes les covariances par paires :
34
35
$$\boxed{ \Sigma = \mathbb{E}\!\left[(x - \mu)(x - \mu)^T\right], \qquad \Sigma_{ij} = \mathrm{Cov}(x_i, x_j) }$$
36
37
Sa diagonale contient les variances de chaque caractéristique, elle est symétrique et semi-définie positive. Les termes hors diagonale enregistrent la corrélation entre caractéristiques.
38
39
## 1.4 La gaussienne multivariée
40
41
La gaussienne est le modèle par défaut pour un bruit continu et pour des nuages de points réguliers. En dimension $n$ elle est paramétrée par un vecteur moyenne $\mu$ et une matrice de covariance $\Sigma$ :
42
43
$$\boxed{ p(x) = \frac{1}{(2\pi)^{n/2}\,|\Sigma|^{1/2}} \exp\!\left(-\tfrac{1}{2}(x - \mu)^T \Sigma^{-1}(x - \mu)\right) }$$
44
45
Ses courbes de niveau de densité constante sont des ellipsoïdes centrés en $\mu$, et la covariance $\Sigma$ fixe leur étalement et leur orientation.
46
47
![La gaussienne multivariée pour trois formes de covariance](/fr/Mathematics/01%20Mathematical%20refresher/a/multivariate-gaussian.png)
48
49
*Une covariance sphérique donne des courbes circulaires, une covariance diagonale des ellipses alignées sur les axes, et les termes hors diagonale les inclinent, encodant la corrélation entre les caractéristiques.*
50
51
*Remarque :* la forme quadratique $(x - \mu)^T \Sigma^{-1}(x - \mu)$ est le carré de la distance de Mahalanobis, la distance naturelle une fois que les données ont une structure de covariance.
52
53
## 1.5 Vraisemblance, a priori, a posteriori et évidence
54
55
Presque tous les modèles de ce cours raisonnent sur des paramètres $\theta$ étant donné des données $D$. Quatre quantités reviennent, reliées entre elles par la règle de Bayes :
56
57
$$\boxed{ p(\theta \mid D) = \frac{p(D \mid \theta)\, p(\theta)}{p(D)} }$$
58
59
- La **vraisemblance** $p(D \mid \theta)$ est la probabilité des données pour un $\theta$ donné.
60
- L'**a priori** $p(\theta)$ est ce que l'on croyait sur $\theta$ avant de voir les données.
61
- L'**a posteriori** $p(\theta \mid D)$ est la croyance mise à jour après les avoir vues.
62
- L'**évidence** $p(D) = \int p(D \mid \theta)\, p(\theta)\, d\theta$ normalise l'a posteriori pour qu'il intègre à un.
63
64
![La règle de Bayes combine a priori et vraisemblance en un a posteriori](/fr/Mathematics/01%20Mathematical%20refresher/a/bayes-rule.svg)
65
66
*L'a posteriori est proportionnel à la vraisemblance fois l'a priori, divisé par l'évidence qui en fait une vraie distribution.*
67
68
*Remarque :* l'évidence est une constante par rapport à $\theta$, donc pour de nombreuses tâches on peut l'ignorer et seul le numérateur $p(D \mid \theta)\, p(\theta)$ compte.
69
70
*Ces outils sous-tendent le cours [Machine Learning](/fr/Machine%20Learning), où les probabilités, les fonctions de perte et les modèles s'appuient sur eux.*
71
72
---
73
Suivant : [Vue d'ensemble du cours](/fr/Mathematics)