Blame

e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
1
# 4. Formulation probabiliste
2
3
La probabilité est le langage que le machine learning utilise pour traiter l'incertitude. Ce module énonce les règles pour les variables discrètes et continues, jette un premier regard sur la théorie de l'information, montre la manière bayésienne de transformer des probabilités en décisions, et définit les deux principes d'estimation auxquels le cours revient sans cesse : le maximum de vraisemblance et le maximum a posteriori.
4
5
**Objectifs**
6
- Énoncer les règles de la probabilité pour les variables discrètes et continues.
7
- Relier les probabilités conjointe, conditionnelle et marginale par les règles de la somme et du produit et par la règle de Bayes.
8
- Mesurer l'incertitude avec l'entropie, l'entropie croisée et la divergence de Kullback-Leibler.
9
- Prendre la décision qui minimise la perte espérée, et retrouver le classifieur du maximum a posteriori.
10
- Définir les estimateurs du maximum de vraisemblance et du maximum a posteriori.
11
12
## 4.1 Probabilité, discrète et continue
13
14
Une variable aléatoire prend des valeurs avec des probabilités qui sont positives et qui somment ou s'intègrent à un. Une variable discrète a une fonction de masse, une variable continue une densité de probabilité :
15
16
$$\boxed{ \sum_x p(x) = 1 \qquad \int p(x)\, dx = 1, \quad p(x) \ge 0 }$$
17
18
Pour une variable continue, la probabilité s'attache à des intervalles au moyen d'une intégrale, $P(a \le X \le b) = \int_a^b p(x)\, dx$, et non à des points isolés.
19
20
## 4.2 Conjointe, conditionnelle et Bayes
21
22
Deux variables ont une distribution conjointe $p(x, y)$. Sommer (ou intégrer) une variable donne la marginale, la règle de la somme, et la conjointe se factorise en une conditionnelle fois une marginale, la règle du produit :
23
24
$$\boxed{ p(x) = \sum_y p(x, y) \qquad p(x, y) = p(y \mid x)\, p(x) }$$
25
26
En réarrangeant la règle du produit dans les deux sens on obtient la règle de Bayes, qui inverse une conditionnelle :
27
28
$$\boxed{ p(y \mid x) = \frac{p(x \mid y)\, p(y)}{p(x)} }$$
29
30
Deux variables sont indépendantes quand la conjointe est le produit des marginales, $p(x, y) = p(x)\, p(y)$.
31
32
## 4.3 Un peu de théorie de l'information
33
34
L'entropie d'une distribution mesure son incertitude, le nombre moyen de bits nécessaires pour décrire une issue :
35
36
$$\boxed{ H(X) = -\sum_x p(x)\log p(x) }$$
37
38
![Entropie binaire](/fr/Machine%20Learning/04%20Probabilistic%20formulation/a/entropy.png)
39
40
*Pour une variable à deux issues, l'entropie est maximale en $p = 0.5$, là où l'issue est la plus difficile à prévoir, et nulle quand une issue est certaine.*
41
42
L'entropie croisée mesure le coût d'utiliser un modèle $q$ quand la vérité est $p$, et la divergence de Kullback-Leibler mesure à quelle distance $q$ se trouve de $p$ :
43
44
$$\boxed{ H(p, q) = -\sum_x p(x)\log q(x) \qquad D_{\mathrm{KL}}(p \,\|\, q) = \sum_x p(x)\log\frac{p(x)}{q(x)} \ge 0 }$$
45
46
*Remarque :* minimiser l'entropie croisée entre les vraies étiquettes et les prédictions d'un modèle revient à maximiser la vraisemblance de ces étiquettes. C'est pourquoi les réseaux de classification minimisent l'entropie croisée, un fil repris dans les modules suivants.
47
48
## 4.4 Théorie de la décision bayésienne
49
50
Pour classer une entrée $x$, la règle bayésienne utilise l'a posteriori sur les classes. Sous la perte 0-1, la décision qui minimise la perte espérée est simplement la classe la plus probable, et comme l'a posteriori est proportionnel à la densité conditionnelle de classe fois l'a priori, on peut la calculer des deux façons :
51
52
$$\boxed{ \hat{y} = \arg\max_y \; p(y \mid x) = \arg\max_y \; p(x \mid y)\, p(y) }$$
53
54
![Décision bayésienne entre deux classes](/fr/Machine%20Learning/04%20Probabilistic%20formulation/a/bayes-decision.png)
55
56
*Chaque classe apporte sa densité mise à l'échelle par son a priori, et la frontière de décision tombe là où les deux sont égales. De chaque côté, la classe au plus grand a posteriori l'emporte.*
57
58
*Remarque :* c'est le classifieur optimal, appelé classifieur de Bayes. Chaque méthode plus loin dans le cours est, en pratique, une tentative d'approcher ces a posteriori à partir des données.
59
60
## 4.5 Maximum de vraisemblance et maximum a posteriori
61
62
On connaît rarement la vraie distribution, on estime donc ses paramètres $\theta$ à partir des données. Le maximum de vraisemblance choisit le $\theta$ qui rend les données observées les plus probables, maximisé en général comme une somme de log-vraisemblances sur les $m$ exemples :
63
64
$$\boxed{ \theta_{\mathrm{MV}} = \arg\max_\theta \sum_{i=1}^{m} \log p(x^{(i)} \mid \theta) }$$
65
66
Le maximum a posteriori maximise plutôt l'a posteriori, qui multiplie la vraisemblance par un a priori sur $\theta$ :
67
68
$$\boxed{ \theta_{\mathrm{MAP}} = \arg\max_\theta \; p(D \mid \theta)\, p(\theta) }$$
69
70
*Remarque :* le maximum a posteriori est le maximum de vraisemblance augmenté d'un a priori. Un a priori gaussien sur $\theta$ devient une pénalité L2 et un a priori de Laplace une pénalité L1, ce qui est exactement la régularisation d'un module ultérieur. Avec beaucoup de données l'a priori s'efface et les deux estimateurs coïncident.
71
72
*Le module suivant transforme ces principes en fonctions de perte concrètes et en la descente de gradient qui les minimise.*
73
74
---
75
Suivant : [Régression linéaire](/fr/Machine%20Learning/05%20Linear%20regression) · [Vue d'ensemble du cours](/fr/Machine%20Learning)