Blame

e0287e lugonthier 2026-07-02 15:52:15
Add new content and images for machine learning and mathematics modules - Added images for regularization and high-dimensional inference. - Introduced Support Vector Machines (SVM) module with detailed explanations and images. - Created Decision Trees and Ensemble Methods module with comprehensive content and illustrations. - Added a Mathematics overview module and a refresher on mathematical concepts essential for machine learning. - Included SVG diagrams for Bayes' rule and multivariate Gaussian distribution.
1
# 5. Régression linéaire
2
3
La régression linéaire prédit une cible continue à partir d'un score linéaire $\theta^T x$. Ce module la présente de façon probabiliste, en prolongeant le module [Formulation probabiliste](/fr/Machine%20Learning/04%20Probabilistic%20formulation) : le modèle (étendu aux caractéristiques polynomiales), l'ajustement par maximum de vraisemblance, qui se révèle être les moindres carrés ordinaires, et l'ajustement par maximum a posteriori, qui ajoute un a priori et donne un ajustement régularisé.
4
5
**Objectifs**
6
- Écrire le modèle de régression linéaire et polynomiale et l'ajuster par moindres carrés.
7
- Donner à la régression une formulation probabiliste avec un bruit gaussien.
8
- Voir que le maximum de vraisemblance sous ce modèle est exactement les moindres carrés.
9
- Ajouter un a priori et ajuster par maximum a posteriori, retrouvant un ajustement régularisé.
10
11
## 5.1 Le modèle linéaire et polynomial
12
13
L'hypothèse est linéaire en l'entrée augmentée $x \in \mathbb{R}^{n+1}$ avec $x_0 = 1$ et les paramètres $\theta$ :
14
15
$$\boxed{ h_\theta(x) = \theta^T x }$$
16
17
La régression polynomiale est le même modèle appliqué à une transformation des caractéristiques. Remplacer $x$ par $\phi(x) = (1, x, x^2, \dots, x^d)$ ajuste un polynôme de degré $d$ tout en restant linéaire en les paramètres :
18
19
$$\boxed{ h_\theta(x) = \theta^T \phi(x) = \sum_{j=0}^{d} \theta_j\, x^{j} }$$
20
21
donc tout ce qui suit s'applique tel quel une fois que la matrice de conception $X$ empile les entrées transformées $\phi(x^{(i)})$ sur ses lignes.
22
23
## 5.2 Moindres carrés
24
25
Le coût est la demi-somme des carrés des résidus sur les $m$ exemples :
26
27
$$\boxed{ J(\theta) = \tfrac{1}{2}\sum_{i=1}^{m}\left(h_\theta(x^{(i)}) - y^{(i)}\right)^2 }$$
28
29
Poser $\nabla_\theta J = 0$ donne l'équation normale sous forme close, et la descente de gradient donne la mise à jour itérative équivalente :
30
31
$$\boxed{ \theta = (X^T X)^{-1}X^T y \qquad \theta_j \leftarrow \theta_j + \alpha\left(y^{(i)} - h_\theta(x^{(i)})\right)x_j^{(i)} }$$
32
33
![Ajustement par régression linéaire](/fr/Machine%20Learning/05%20Linear%20regression/a/linear-regression.png)
34
35
*Les moindres carrés ajustent la courbe qui minimise les résidus au carré (segments gris).*
36
37
## 5.3 Formulation probabiliste : maximum de vraisemblance
38
39
Donnons aux données une histoire générative : chaque cible est la prédiction linéaire plus un bruit gaussien indépendant,
40
41
$$\boxed{ y^{(i)} = \theta^T x^{(i)} + \varepsilon^{(i)}, \quad \varepsilon^{(i)} \sim \mathcal{N}(0, \sigma^2) }$$
42
43
donc $p(y^{(i)} \mid x^{(i)}; \theta) = \mathcal{N}(\theta^T x^{(i)}, \sigma^2)$. Maximiser la log-vraisemblance sur les $m$ exemples i.i.d. élimine tout terme indépendant de $\theta$ et laisse le coût des moindres carrés :
44
45
$$\boxed{ \arg\max_\theta \ell(\theta) = \arg\min_\theta \sum_{i=1}^{m}\left(y^{(i)} - \theta^T x^{(i)}\right)^2 }$$
46
47
*Remarque :* c'est pourquoi les moindres carrés sont un objectif fondé et pas seulement commode. Les moindres carrés ordinaires sont l'estimation du maximum de vraisemblance sous un bruit gaussien, exactement le principe du maximum de vraisemblance du module précédent.
48
49
## 5.4 Maximum a posteriori
50
51
Le maximum de vraisemblance peut surapprendre, surtout à haut degré polynomial. Placer un a priori gaussien centré sur les paramètres, $\theta \sim \mathcal{N}(0, \tau^2 I)$, et maximiser l'a posteriori ajoute une pénalité sur leur taille :
52
53
$$\boxed{ \theta_{\mathrm{MAP}} = \arg\min_\theta \; \sum_{i=1}^{m}\left(y^{(i)} - \theta^T x^{(i)}\right)^2 + \lambda \lVert \theta \rVert_2^2, \quad \lambda = \frac{\sigma^2}{\tau^2} }$$
54
55
C'est la régression régularisée (ridge) : l'a priori gaussien devient une pénalité L2, exactement le lien a priori vers pénalité noté au module précédent.
56
57
*Remarque :* un a priori plus fort (petit $\tau$) signifie un $\lambda$ plus grand et un rétrécissement plus marqué vers zéro. Avec beaucoup de données, la vraisemblance domine l'a priori et l'ajustement du maximum a posteriori se rapproche de celui du maximum de vraisemblance. Choisir le degré $d$ et la pénalité $\lambda$ est un problème de sélection de modèle, réglé par la validation croisée du [module d'évaluation](/fr/Machine%20Learning/03%20Model%20evaluation%20and%20validation), et approfondi dans le [module de régularisation](/fr/Machine%20Learning/07%20Regularization%20and%20high-dimensional%20inference).
58
59
*Le même score linéaire, passé dans une fonction de compression au lieu d'être lu directement, transforme la régression en classification, le sujet du module suivant.*
60
61
---
62
Suivant : [Classification linéaire](/fr/Machine%20Learning/06%20Linear%20classification) · [Vue d'ensemble du cours](/fr/Machine%20Learning)