Blame

0ad9b6 lugonthier 2026-07-10 12:03:30
Remove "07 Regularization and high-dimensional inference" chapter and add "07 Support Vector Machines" and "08 Decision trees and ensemble methods" chapters with corresponding images.
1
# 3. Formulation probabiliste
e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
2
3
La probabilité est le langage que le machine learning utilise pour traiter l'incertitude. Ce module énonce les règles pour les variables discrètes et continues, jette un premier regard sur la théorie de l'information, montre la manière bayésienne de transformer des probabilités en décisions, et définit les deux principes d'estimation auxquels le cours revient sans cesse : le maximum de vraisemblance et le maximum a posteriori.
4
5
**Objectifs**
6
- Énoncer les règles de la probabilité pour les variables discrètes et continues.
7
- Relier les probabilités conjointe, conditionnelle et marginale par les règles de la somme et du produit et par la règle de Bayes.
8
- Mesurer l'incertitude avec l'entropie, l'entropie croisée et la divergence de Kullback-Leibler.
9
- Prendre la décision qui minimise la perte espérée, et retrouver le classifieur du maximum a posteriori.
10
- Définir les estimateurs du maximum de vraisemblance et du maximum a posteriori.
11
0ad9b6 lugonthier 2026-07-10 12:03:30
Remove "07 Regularization and high-dimensional inference" chapter and add "07 Support Vector Machines" and "08 Decision trees and ensemble methods" chapters with corresponding images.
12
## 3.1 Probabilité, discrète et continue
e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
13
14
Une variable aléatoire prend des valeurs avec des probabilités qui sont positives et qui somment ou s'intègrent à un. Une variable discrète a une fonction de masse, une variable continue une densité de probabilité :
15
16
$$\boxed{ \sum_x p(x) = 1 \qquad \int p(x)\, dx = 1, \quad p(x) \ge 0 }$$
17
18
Pour une variable continue, la probabilité s'attache à des intervalles au moyen d'une intégrale, $P(a \le X \le b) = \int_a^b p(x)\, dx$, et non à des points isolés.
19
0ad9b6 lugonthier 2026-07-10 12:03:30
Remove "07 Regularization and high-dimensional inference" chapter and add "07 Support Vector Machines" and "08 Decision trees and ensemble methods" chapters with corresponding images.
20
## 3.2 Conjointe, conditionnelle et Bayes
e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
21
22
Deux variables ont une distribution conjointe $p(x, y)$. Sommer (ou intégrer) une variable donne la marginale, la règle de la somme, et la conjointe se factorise en une conditionnelle fois une marginale, la règle du produit :
23
24
$$\boxed{ p(x) = \sum_y p(x, y) \qquad p(x, y) = p(y \mid x)\, p(x) }$$
25
26
En réarrangeant la règle du produit dans les deux sens on obtient la règle de Bayes, qui inverse une conditionnelle :
27
28
$$\boxed{ p(y \mid x) = \frac{p(x \mid y)\, p(y)}{p(x)} }$$
29
30
Deux variables sont indépendantes quand la conjointe est le produit des marginales, $p(x, y) = p(x)\, p(y)$.
31
0ad9b6 lugonthier 2026-07-10 12:03:30
Remove "07 Regularization and high-dimensional inference" chapter and add "07 Support Vector Machines" and "08 Decision trees and ensemble methods" chapters with corresponding images.
32
## 3.3 Un peu de théorie de l'information
e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
33
34
L'entropie d'une distribution mesure son incertitude, le nombre moyen de bits nécessaires pour décrire une issue :
35
36
$$\boxed{ H(X) = -\sum_x p(x)\log p(x) }$$
37
0ad9b6 lugonthier 2026-07-10 12:03:30
Remove "07 Regularization and high-dimensional inference" chapter and add "07 Support Vector Machines" and "08 Decision trees and ensemble methods" chapters with corresponding images.
38
![Entropie binaire](/fr/Machine%20Learning/03%20Probabilistic%20formulation/a/entropy.png)
e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
39
40
*Pour une variable à deux issues, l'entropie est maximale en $p = 0.5$, là où l'issue est la plus difficile à prévoir, et nulle quand une issue est certaine.*
41
42
L'entropie croisée mesure le coût d'utiliser un modèle $q$ quand la vérité est $p$, et la divergence de Kullback-Leibler mesure à quelle distance $q$ se trouve de $p$ :
43
44
$$\boxed{ H(p, q) = -\sum_x p(x)\log q(x) \qquad D_{\mathrm{KL}}(p \,\|\, q) = \sum_x p(x)\log\frac{p(x)}{q(x)} \ge 0 }$$
45
46
*Remarque :* minimiser l'entropie croisée entre les vraies étiquettes et les prédictions d'un modèle revient à maximiser la vraisemblance de ces étiquettes. C'est pourquoi les réseaux de classification minimisent l'entropie croisée, un fil repris dans les modules suivants.
47
0ad9b6 lugonthier 2026-07-10 12:03:30
Remove "07 Regularization and high-dimensional inference" chapter and add "07 Support Vector Machines" and "08 Decision trees and ensemble methods" chapters with corresponding images.
48
## 3.4 Théorie de la décision bayésienne
e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
49
50
Pour classer une entrée $x$, la règle bayésienne utilise l'a posteriori sur les classes. Sous la perte 0-1, la décision qui minimise la perte espérée est simplement la classe la plus probable, et comme l'a posteriori est proportionnel à la densité conditionnelle de classe fois l'a priori, on peut la calculer des deux façons :
51
52
$$\boxed{ \hat{y} = \arg\max_y \; p(y \mid x) = \arg\max_y \; p(x \mid y)\, p(y) }$$
53
0ad9b6 lugonthier 2026-07-10 12:03:30
Remove "07 Regularization and high-dimensional inference" chapter and add "07 Support Vector Machines" and "08 Decision trees and ensemble methods" chapters with corresponding images.
54
![Décision bayésienne entre deux classes](/fr/Machine%20Learning/03%20Probabilistic%20formulation/a/bayes-decision.png)
e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
55
56
*Chaque classe apporte sa densité mise à l'échelle par son a priori, et la frontière de décision tombe là où les deux sont égales. De chaque côté, la classe au plus grand a posteriori l'emporte.*
57
58
*Remarque :* c'est le classifieur optimal, appelé classifieur de Bayes. Chaque méthode plus loin dans le cours est, en pratique, une tentative d'approcher ces a posteriori à partir des données.
59
0ad9b6 lugonthier 2026-07-10 12:03:30
Remove "07 Regularization and high-dimensional inference" chapter and add "07 Support Vector Machines" and "08 Decision trees and ensemble methods" chapters with corresponding images.
60
## 3.5 Maximum de vraisemblance et maximum a posteriori
e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
61
62
On connaît rarement la vraie distribution, on estime donc ses paramètres $\theta$ à partir des données. Le maximum de vraisemblance choisit le $\theta$ qui rend les données observées les plus probables, maximisé en général comme une somme de log-vraisemblances sur les $m$ exemples :
63
64
$$\boxed{ \theta_{\mathrm{MV}} = \arg\max_\theta \sum_{i=1}^{m} \log p(x^{(i)} \mid \theta) }$$
65
0ad9b6 lugonthier 2026-07-10 12:03:30
Remove "07 Regularization and high-dimensional inference" chapter and add "07 Support Vector Machines" and "08 Decision trees and ensemble methods" chapters with corresponding images.
66
En apprentissage supervisé le modèle paramètre la conditionnelle $p(y \mid x; \theta)$, le même principe s'applique donc à la vraisemblance conditionnelle des cibles :
67
68
$$\boxed{ \ell(\theta) = \sum_{i=1}^{m} \log p\!\left(y^{(i)} \mid x^{(i)}; \theta\right) }$$
69
70
Maximiser $\ell$ revient à minimiser le coût $J(\theta) = -\ell(\theta)$ : la vue par la vraisemblance et la vue par minimisation du coût de [Concepts généraux](/fr/Machine%20Learning/02%20General%20concepts) sont deux faces d'un même objectif.
71
e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
72
Le maximum a posteriori maximise plutôt l'a posteriori, qui multiplie la vraisemblance par un a priori sur $\theta$ :
73
74
$$\boxed{ \theta_{\mathrm{MAP}} = \arg\max_\theta \; p(D \mid \theta)\, p(\theta) }$$
75
0ad9b6 lugonthier 2026-07-10 12:03:30
Remove "07 Regularization and high-dimensional inference" chapter and add "07 Support Vector Machines" and "08 Decision trees and ensemble methods" chapters with corresponding images.
76
*Remarque :* le maximum a posteriori est le maximum de vraisemblance augmenté d'un a priori. Un a priori gaussien sur $\theta$ devient une pénalité L2 et un a priori de Laplace une pénalité L1, ce qui est exactement la régularisation du module suivant. Avec beaucoup de données l'a priori s'efface et les deux estimateurs coïncident.
e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
77
0ad9b6 lugonthier 2026-07-10 12:03:30
Remove "07 Regularization and high-dimensional inference" chapter and add "07 Support Vector Machines" and "08 Decision trees and ensemble methods" chapters with corresponding images.
78
*Le module suivant transforme ces principes en un premier modèle concret : la régression linéaire, où maximum de vraisemblance et maximum a posteriori aboutissent tous deux à des ajustements en forme close.*
e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
79
80
---
0ad9b6 lugonthier 2026-07-10 12:03:30
Remove "07 Regularization and high-dimensional inference" chapter and add "07 Support Vector Machines" and "08 Decision trees and ensemble methods" chapters with corresponding images.
81
Suivant : [Régression linéaire](/fr/Machine%20Learning/04%20Linear%20regression) · [Vue d'ensemble du cours](/fr/Machine%20Learning)