Blame
|
1 | # 1. Rappels mathématiques |
||||||
| 2 | ||||||||
| 3 | Ce module rassemble les outils mathématiques sur lesquels s'appuie le reste du cours : un peu d'algèbre linéaire, le langage de l'espérance et de la covariance, la gaussienne multivariée, et les quatre quantités probabilistes (vraisemblance, a priori, a posteriori, évidence) que le module suivant transforme en une manière de raisonner. C'est une référence à consulter, pas un traitement complet. |
|||||||
| 4 | ||||||||
| 5 | **Objectifs** |
|||||||
| 6 | - Rappeler les opérations sur vecteurs et matrices utilisées partout : produit scalaire, produit matrice-vecteur, transposée, inverse et norme. |
|||||||
| 7 | - Définir l'espérance, la variance et la covariance, et assembler la matrice de covariance. |
|||||||
| 8 | - Écrire la densité de la gaussienne multivariée et lire sa forme à partir de la covariance. |
|||||||
| 9 | - Nommer la vraisemblance, l'a priori, l'a posteriori et l'évidence, et les relier par la règle de Bayes. |
|||||||
| 10 | ||||||||
| 11 | ## 1.1 Algèbre linéaire |
|||||||
| 12 | ||||||||
| 13 | Un vecteur de caractéristiques vit dans $\mathbb{R}^n$ et un jeu de données empile de tels vecteurs dans une matrice. Le produit scalaire de deux vecteurs somme leurs produits terme à terme : |
|||||||
| 14 | ||||||||
| 15 | $$\boxed{ x^T y = \sum_{i=1}^{n} x_i\, y_i }$$ |
|||||||
| 16 | ||||||||
| 17 | Une matrice $A$ transforme un vecteur par le produit matrice-vecteur $Ax$, la transposée $A^T$ échange lignes et colonnes, et l'inverse $A^{-1}$ (quand elle existe) annule $A$, donc $A^{-1}A = I$. La norme euclidienne mesure la longueur : |
|||||||
| 18 | ||||||||
| 19 | $$\boxed{ \lVert x \rVert_2 = \sqrt{x^T x} }$$ |
|||||||
| 20 | ||||||||
| 21 | Une matrice carrée est symétrique si $A = A^T$, et semi-définie positive si $x^T A x \ge 0$ pour tout $x$. Les matrices de covariance, qui apparaissent juste après, sont toujours symétriques et semi-définies positives. |
|||||||
| 22 | ||||||||
| 23 | ## 1.2 Espérance et variance |
|||||||
| 24 | ||||||||
| 25 | L'espérance est la moyenne pondérée par les probabilités d'une variable aléatoire, une somme dans le cas discret et une intégrale dans le cas continu : |
|||||||
| 26 | ||||||||
| 27 | $$\boxed{ \mathbb{E}[X] = \sum_x x\, p(x) \qquad \mathbb{E}[X] = \int x\, p(x)\, dx }$$ |
|||||||
| 28 | ||||||||
| 29 | L'espérance est linéaire, $\mathbb{E}[aX + b] = a\,\mathbb{E}[X] + b$. La variance mesure la dispersion autour de la moyenne $\mu = \mathbb{E}[X]$ : |
|||||||
| 30 | ||||||||
| 31 | $$\boxed{ \mathrm{Var}(X) = \mathbb{E}\!\left[(X - \mu)^2\right] = \mathbb{E}[X^2] - \mu^2 }$$ |
|||||||
| 32 | ||||||||
| 33 | ## 1.3 Covariance et matrice de covariance |
|||||||
| 34 | ||||||||
| 35 | La covariance mesure comment deux variables évoluent ensemble : |
|||||||
| 36 | ||||||||
| 37 | $$\boxed{ \mathrm{Cov}(X, Y) = \mathbb{E}\!\left[(X - \mu_X)(Y - \mu_Y)\right] }$$ |
|||||||
| 38 | ||||||||
| 39 | Pour un vecteur aléatoire $x \in \mathbb{R}^n$ de moyenne $\mu$, la matrice de covariance rassemble toutes les covariances par paires : |
|||||||
| 40 | ||||||||
| 41 | $$\boxed{ \Sigma = \mathbb{E}\!\left[(x - \mu)(x - \mu)^T\right], \qquad \Sigma_{ij} = \mathrm{Cov}(x_i, x_j) }$$ |
|||||||
| 42 | ||||||||
| 43 | Sa diagonale contient les variances de chaque caractéristique, elle est symétrique et semi-définie positive. Les termes hors diagonale enregistrent la corrélation entre caractéristiques. |
|||||||
| 44 | ||||||||
| 45 | ## 1.4 La gaussienne multivariée |
|||||||
| 46 | ||||||||
| 47 | La gaussienne est le modèle par défaut pour un bruit continu et pour des nuages de points réguliers. En dimension $n$ elle est paramétrée par un vecteur moyenne $\mu$ et une matrice de covariance $\Sigma$ : |
|||||||
| 48 | ||||||||
| 49 | $$\boxed{ p(x) = \frac{1}{(2\pi)^{n/2}\,|\Sigma|^{1/2}} \exp\!\left(-\tfrac{1}{2}(x - \mu)^T \Sigma^{-1}(x - \mu)\right) }$$ |
|||||||
| 50 | ||||||||
| 51 | Ses courbes de niveau de densité constante sont des ellipsoïdes centrés en $\mu$, et la covariance $\Sigma$ fixe leur étalement et leur orientation. |
|||||||
| 52 | ||||||||
| 53 |  |
|||||||
| 54 | ||||||||
| 55 | *Une covariance sphérique donne des courbes circulaires, une covariance diagonale des ellipses alignées sur les axes, et les termes hors diagonale les inclinent, encodant la corrélation entre les caractéristiques.* |
|||||||
| 56 | ||||||||
| 57 | *Remarque :* la forme quadratique $(x - \mu)^T \Sigma^{-1}(x - \mu)$ est le carré de la distance de Mahalanobis, la distance naturelle une fois que les données ont une structure de covariance. |
|||||||
| 58 | ||||||||
| 59 | ## 1.5 Vraisemblance, a priori, a posteriori et évidence |
|||||||
| 60 | ||||||||
| 61 | Presque tous les modèles de ce cours raisonnent sur des paramètres $\theta$ étant donné des données $D$. Quatre quantités reviennent, reliées entre elles par la règle de Bayes : |
|||||||
| 62 | ||||||||
| 63 | $$\boxed{ p(\theta \mid D) = \frac{p(D \mid \theta)\, p(\theta)}{p(D)} }$$ |
|||||||
| 64 | ||||||||
| 65 | - La **vraisemblance** $p(D \mid \theta)$ est la probabilité des données pour un $\theta$ donné. |
|||||||
| 66 | - L'**a priori** $p(\theta)$ est ce que l'on croyait sur $\theta$ avant de voir les données. |
|||||||
| 67 | - L'**a posteriori** $p(\theta \mid D)$ est la croyance mise à jour après les avoir vues. |
|||||||
| 68 | - L'**évidence** $p(D) = \int p(D \mid \theta)\, p(\theta)\, d\theta$ normalise l'a posteriori pour qu'il intègre à un. |
|||||||
| 69 | ||||||||
| 70 |  |
|||||||
| 71 | ||||||||
| 72 | *L'a posteriori est proportionnel à la vraisemblance fois l'a priori, divisé par l'évidence qui en fait une vraie distribution.* |
|||||||
| 73 | ||||||||
| 74 | *Remarque :* l'évidence est une constante par rapport à $\theta$, donc pour de nombreuses tâches on peut l'ignorer et seul le numérateur $p(D \mid \theta)\, p(\theta)$ compte. |
|||||||
| 75 | ||||||||
| 76 | *Ces outils sous-tendent le cours [Machine Learning](/fr/Machine%20Learning), où les probabilités, les fonctions de perte et les modèles s'appuient sur eux.* |
|||||||
| 77 | ||||||||
| 78 | --- |
|||||||
| 79 | Suivant : [Vue d'ensemble du cours](/fr/Mathematics) |
|||||||
