4. Modèles linéaires
Les modèles linéaires prédisent à partir d'un score linéaire \(\theta^T x\). Ce module couvre la régression linéaire (cibles continues), la régression logistique (classification binaire) et le cadre des modèles linéaires généralisés qui unifie les deux via la famille exponentielle. Chaque modèle est ajusté par maximum de vraisemblance et partage la même mise à jour par gradient.
Objectifs
- Définir l'hypothèse linéaire et ajuster \(\theta\) par la mise à jour LMS ou par l'équation normale en forme close.
- Comprendre pourquoi les moindres carrés sont l'estimation du maximum de vraisemblance sous bruit gaussien.
- Transformer le score linéaire en probabilité via la sigmoïde et l'ajuster par montée de gradient ou méthode de Newton.
- Classer avec le perceptron et savoir quand sa règle d'apprentissage converge.
- Reconnaître la forme de la famille exponentielle et construire un MLG à partir de ses trois hypothèses.
- Retrouver les régressions linéaire, logistique et softmax comme cas particuliers.
4.1 Régression linéaire
4.1.1 Hypothèse
L'hypothèse est linéaire en l'entrée augmentée \(x \in \mathbb{R}^{n+1}\) avec \(x_0 = 1\) et les paramètres \(\theta \in \mathbb{R}^{n+1}\) :
\[\boxed{ h_\theta(x) = \theta^T x }\]4.1.2 Fonction de coût
Le coût est défini comme la demi-somme des carrés des résidus sur les \(m\) exemples :
\[\boxed{ J(\theta) = \tfrac{1}{2}\sum_{i=1}^{m}\left(h_\theta(x^{(i)}) - y^{(i)}\right)^2 }\]4.1.3 Mise à jour LMS
La descente de gradient sur \(J\) donne la mise à jour des moindres carrés moyens (Widrow-Hoff), appliquée par exemple \((x^{(i)}, y^{(i)})\) :
\[\boxed{ \theta_j \leftarrow \theta_j + \alpha\left(y^{(i)} - h_\theta(x^{(i)})\right)x_j^{(i)} }\]avec un taux d'apprentissage \(\alpha > 0\).
| variante | règle de mise à jour | par étape | à utiliser quand |
|---|---|---|---|
| GD par lots | somme sur les \(m\) exemples | \(O(mn)\) | \(m\) petit à modéré |
| GD stochastique (SGD) | un exemple à la fois | \(O(n)\) | \(m\) grand, flux de données |
4.1.4 Équation normale
Annuler \(\nabla_\theta J(\theta) = 0\) donne une solution en forme close à partir de la matrice de conception \(X\) et du vecteur cible \(y\) :
\[\boxed{ \theta = (X^T X)^{-1}X^T y }\]Remarque : l'équation normale ne demande ni taux d'apprentissage ni itération, mais inverser \(X^T X\) coûte \(O(n^3)\), donc pour \(n\) grand la mise à jour itérative LMS est préférée.
4.1.5 Interprétation probabiliste
Supposons \(y^{(i)} = \theta^T x^{(i)} + \varepsilon^{(i)}\) avec un bruit gaussien i.i.d. \(\varepsilon^{(i)} \sim \mathcal{N}(0, \sigma^2)\). Maximiser la log-vraisemblance revient alors à minimiser le coût des moindres carrés :
\[\boxed{ \arg\max_\theta \ell(\theta) = \arg\min_\theta J(\theta) }\]Remarque : c'est pourquoi les moindres carrés sont un objectif fondé et pas seulement commode.

Les moindres carrés ajustent la droite qui minimise les résidus au carré (segments gris).
4.2 Régression logistique
4.2.1 Sigmoïde
La fonction sigmoïde (logistique) comprime un score brut \(z \in \mathbb{R}\) en une probabilité :
\[\boxed{ g(z) = \frac{1}{1 + e^{-z}} \in (0, 1) }\]Sa dérivée a la forme commode \(g'(z) = g(z)\left(1 - g(z)\right)\).
4.2.2 Modèle
L'hypothèse renvoie la probabilité de la classe positive, \(\phi\) étant la probabilité prédite :
\[\boxed{ \phi = h_\theta(x) = g(\theta^T x) = p(y = 1 \mid x; \theta) }\]Les étiquettes valent \(y \in \{0, 1\}\), donc la loi conditionnelle est de Bernoulli :
\[\boxed{ p(y \mid x; \theta) = \phi^{y}(1 - \phi)^{1 - y} }\]4.2.3 Log-vraisemblance
Sur \(m\) exemples i.i.d. la log-vraisemblance est l'opposé de l'entropie croisée sommée sur les données :
\[\boxed{ \ell(\theta) = \sum_{i=1}^{m}\left[ y^{(i)}\log \phi^{(i)} + (1 - y^{(i)})\log(1 - \phi^{(i)}) \right] }\]avec \(\phi^{(i)} = h_\theta(x^{(i)})\).
4.2.4 Montée de gradient
Maximiser \(\ell\) par montée de gradient donne la même forme que la mise à jour LMS :
\[\boxed{ \theta_j \leftarrow \theta_j + \alpha\left(y^{(i)} - h_\theta(x^{(i)})\right)x_j^{(i)} }\]Remarque : la mise à jour a la même forme que la régression linéaire, bien que \(h_\theta\) soit maintenant la sigmoïde. Ce n'est pas un hasard, les deux sont des modèles linéaires généralisés.
4.2.5 Méthode de Newton
La méthode de Newton converge plus vite près de l'optimum. En une dimension :
\[\boxed{ \theta \leftarrow \theta - \frac{\ell'(\theta)}{\ell''(\theta)} }\]Dans le cas vectoriel elle utilise la hessienne \(H\) de \(\ell\) :
\[\boxed{ \theta \leftarrow \theta - H^{-1}\nabla_\theta \ell(\theta) }\]Remarque : la régression logistique n'a pas de solution en forme close pour \(\theta\), elle est donc toujours ajustée itérativement (montée de gradient ou Newton).

À gauche : la sigmoïde envoie les scores dans l'intervalle (0,1). À droite : la frontière de décision et la probabilité prédite.
4.3 Perceptron
Le perceptron est le premier classifieur linéaire. Il conserve le score linéaire \(\theta^T x\) de la régression logistique mais remplace la sigmoïde par un seuil dur, donc la sortie est une étiquette de classe et non une probabilité. Les étiquettes valent \(y \in \{0, 1\}\).
4.3.1 Activation et hypothèse
L'activation est la fonction échelon :
\[\boxed{ g(z) = \begin{cases} 1 & \text{si } z \ge 0 \\ 0 & \text{sinon} \end{cases} }\]et l'hypothèse l'applique au score linéaire :
\[\boxed{ h_\theta(x) = g(\theta^T x) }\]4.3.2 Règle d'apprentissage
Le perceptron est entraîné en ligne, un exemple à la fois, et ne corrige \(\theta\) que sur un point mal classé :
\[\boxed{ \theta_j \leftarrow \theta_j + \alpha\left(y^{(i)} - h_\theta(x^{(i)})\right)x_j^{(i)} }\]Remarque : c'est la même forme que la mise à jour LMS et que la montée de gradient logistique. Seule l'activation \(g\) change (identité, sigmoïde, échelon). Quand la prédiction est correcte, le facteur \(y^{(i)} - h_\theta(x^{(i)})\) est nul, donc les points bien classés laissent \(\theta\) inchangé.

Le perceptron trouve un hyperplan séparateur. Ce n'est pas nécessairement celui à marge maximale que choisira le SVM.
4.3.3 Convergence
| données | comportement |
|---|---|
| linéairement séparables | converge en un nombre fini de mises à jour |
| non séparables | ne converge jamais, les poids oscillent |
Remarque : le perceptron s'arrête au premier hyperplan qui sépare les données, généralement pas celui à la marge la plus large. Cet écart motive la machine à vecteurs de support (qui maximise la marge) et, empilé en couches, le réseau de neurones (un perceptron est une unité).
4.4 Modèles linéaires généralisés
4.4.1 Famille exponentielle
Une distribution appartient à la famille exponentielle si sa densité s'écrit avec le paramètre naturel \(\eta\), la statistique suffisante \(T(y)\), la log-partition \(a(\eta)\) et la mesure de base \(b(y)\) :
\[\boxed{ p(y; \eta) = b(y)\exp\left(\eta\, T(y) - a(\eta)\right) }\]4.4.2 Hypothèses du MLG
Un MLG repose sur trois choix. La réponse appartient à la famille exponentielle, le paramètre naturel est linéaire en l'entrée, et la prédiction est la statistique suffisante espérée :
\[\boxed{ \eta = \theta^T x }\] \[\boxed{ h_\theta(x) = \mathbb{E}\left[T(y) \mid x; \theta\right] }\]4.4.3 Tableau des familles
| Distribution | \(\eta\) | \(T(y)\) | \(a(\eta)\) | \(b(y)\) |
|---|---|---|---|---|
| Bernoulli | \(\log\dfrac{\phi}{1-\phi}\) | \(y\) | \(\log(1 + e^{\eta})\) | \(1\) |
| Gaussienne (\(\sigma^2 = 1\)) | \(\mu\) | \(y\) | \(\tfrac{1}{2}\eta^2\) | \(\dfrac{1}{\sqrt{2\pi}}e^{-y^2/2}\) |
| Poisson | \(\log\lambda\) | \(y\) | \(e^{\eta}\) | \(\dfrac{1}{y!}\) |
| Géométrique | \(\log(1-\phi)\) | \(y\) | \(\log\dfrac{e^{\eta}}{1 - e^{\eta}}\) | \(1\) |
Remarque : pour la Bernoulli, \(\eta\) est le log-rapport de cotes et son inverse est la sigmoïde, \(\phi = g(\eta)\). C'est pourquoi la régression logistique a cette forme.
4.4.4 Régression softmax
Pour des étiquettes multiclasses \(y \in \{1, \dots, k\}\) le MLG donne la régression softmax, avec un vecteur de paramètres \(\theta_k\) par classe :
\[\boxed{ p(y = k \mid x; \theta) = \frac{\exp(\theta_k^T x)}{\sum_{j}\exp(\theta_j^T x)} }\]4.4.5 Recette du MLG
graph TD A["choisir une distribution de reponse"] --> B["l ecrire en forme de famille exponentielle"] B --> C["poser le parametre naturel eta lineaire en x"] C --> D["la prediction est la statistique suffisante esperee"] D --> E["ajuster theta par maximum de vraisemblance"]
Les modèles linéaires, y compris le perceptron, se contentent d'une frontière qui sépare les classes. La partie suivante cherche la meilleure : la machine à vecteurs de support maximise la marge.
Suivant : Régularisation et inférence en grande dimension · Vue d'ensemble du cours
