Blame

e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
1
# 1. Rappels mathématiques
2
3
Ce module rassemble les outils mathématiques sur lesquels s'appuie le reste du cours : un peu d'algèbre linéaire, le langage de l'espérance et de la covariance, la gaussienne multivariée, et les quatre quantités probabilistes (vraisemblance, a priori, a posteriori, évidence) que le module suivant transforme en une manière de raisonner. C'est une référence à consulter, pas un traitement complet.
4
5
**Objectifs**
6
- Rappeler les opérations sur vecteurs et matrices utilisées partout : produit scalaire, produit matrice-vecteur, transposée, inverse et norme.
7
- Définir l'espérance, la variance et la covariance, et assembler la matrice de covariance.
8
- Écrire la densité de la gaussienne multivariée et lire sa forme à partir de la covariance.
9
- Nommer la vraisemblance, l'a priori, l'a posteriori et l'évidence, et les relier par la règle de Bayes.
10
11
## 1.1 Algèbre linéaire
12
13
Un vecteur de caractéristiques vit dans $\mathbb{R}^n$ et un jeu de données empile de tels vecteurs dans une matrice. Le produit scalaire de deux vecteurs somme leurs produits terme à terme :
14
15
$$\boxed{ x^T y = \sum_{i=1}^{n} x_i\, y_i }$$
16
17
Une matrice $A$ transforme un vecteur par le produit matrice-vecteur $Ax$, la transposée $A^T$ échange lignes et colonnes, et l'inverse $A^{-1}$ (quand elle existe) annule $A$, donc $A^{-1}A = I$. La norme euclidienne mesure la longueur :
18
19
$$\boxed{ \lVert x \rVert_2 = \sqrt{x^T x} }$$
20
21
Une matrice carrée est symétrique si $A = A^T$, et semi-définie positive si $x^T A x \ge 0$ pour tout $x$. Les matrices de covariance, qui apparaissent juste après, sont toujours symétriques et semi-définies positives.
22
23
## 1.2 Espérance et variance
24
25
L'espérance est la moyenne pondérée par les probabilités d'une variable aléatoire, une somme dans le cas discret et une intégrale dans le cas continu :
26
27
$$\boxed{ \mathbb{E}[X] = \sum_x x\, p(x) \qquad \mathbb{E}[X] = \int x\, p(x)\, dx }$$
28
29
L'espérance est linéaire, $\mathbb{E}[aX + b] = a\,\mathbb{E}[X] + b$. La variance mesure la dispersion autour de la moyenne $\mu = \mathbb{E}[X]$ :
30
31
$$\boxed{ \mathrm{Var}(X) = \mathbb{E}\!\left[(X - \mu)^2\right] = \mathbb{E}[X^2] - \mu^2 }$$
32
33
## 1.3 Covariance et matrice de covariance
34
35
La covariance mesure comment deux variables évoluent ensemble :
36
37
$$\boxed{ \mathrm{Cov}(X, Y) = \mathbb{E}\!\left[(X - \mu_X)(Y - \mu_Y)\right] }$$
38
39
Pour un vecteur aléatoire $x \in \mathbb{R}^n$ de moyenne $\mu$, la matrice de covariance rassemble toutes les covariances par paires :
40
41
$$\boxed{ \Sigma = \mathbb{E}\!\left[(x - \mu)(x - \mu)^T\right], \qquad \Sigma_{ij} = \mathrm{Cov}(x_i, x_j) }$$
42
43
Sa diagonale contient les variances de chaque caractéristique, elle est symétrique et semi-définie positive. Les termes hors diagonale enregistrent la corrélation entre caractéristiques.
44
45
## 1.4 La gaussienne multivariée
46
47
La gaussienne est le modèle par défaut pour un bruit continu et pour des nuages de points réguliers. En dimension $n$ elle est paramétrée par un vecteur moyenne $\mu$ et une matrice de covariance $\Sigma$ :
48
49
$$\boxed{ p(x) = \frac{1}{(2\pi)^{n/2}\,|\Sigma|^{1/2}} \exp\!\left(-\tfrac{1}{2}(x - \mu)^T \Sigma^{-1}(x - \mu)\right) }$$
50
51
Ses courbes de niveau de densité constante sont des ellipsoïdes centrés en $\mu$, et la covariance $\Sigma$ fixe leur étalement et leur orientation.
52
53
![La gaussienne multivariée pour trois formes de covariance](/fr/Mathematics/01%20Mathematical%20refresher/a/multivariate-gaussian.png)
54
55
*Une covariance sphérique donne des courbes circulaires, une covariance diagonale des ellipses alignées sur les axes, et les termes hors diagonale les inclinent, encodant la corrélation entre les caractéristiques.*
56
57
*Remarque :* la forme quadratique $(x - \mu)^T \Sigma^{-1}(x - \mu)$ est le carré de la distance de Mahalanobis, la distance naturelle une fois que les données ont une structure de covariance.
58
59
## 1.5 Vraisemblance, a priori, a posteriori et évidence
60
61
Presque tous les modèles de ce cours raisonnent sur des paramètres $\theta$ étant donné des données $D$. Quatre quantités reviennent, reliées entre elles par la règle de Bayes :
62
63
$$\boxed{ p(\theta \mid D) = \frac{p(D \mid \theta)\, p(\theta)}{p(D)} }$$
64
65
- La **vraisemblance** $p(D \mid \theta)$ est la probabilité des données pour un $\theta$ donné.
66
- L'**a priori** $p(\theta)$ est ce que l'on croyait sur $\theta$ avant de voir les données.
67
- L'**a posteriori** $p(\theta \mid D)$ est la croyance mise à jour après les avoir vues.
68
- L'**évidence** $p(D) = \int p(D \mid \theta)\, p(\theta)\, d\theta$ normalise l'a posteriori pour qu'il intègre à un.
69
70
![La règle de Bayes combine a priori et vraisemblance en un a posteriori](/fr/Mathematics/01%20Mathematical%20refresher/a/bayes-rule.svg)
71
72
*L'a posteriori est proportionnel à la vraisemblance fois l'a priori, divisé par l'évidence qui en fait une vraie distribution.*
73
74
*Remarque :* l'évidence est une constante par rapport à $\theta$, donc pour de nombreuses tâches on peut l'ignorer et seul le numérateur $p(D \mid \theta)\, p(\theta)$ compte.
75
76
*Ces outils sous-tendent le cours [Machine Learning](/fr/Machine%20Learning), où les probabilités, les fonctions de perte et les modèles s'appuient sur eux.*
77
78
---
79
Suivant : [Vue d'ensemble du cours](/fr/Mathematics)