Prior, vraisemblance, posterior: la machine a apprendre
Dans le module Naive Bayes, le theoreme de Bayes servait a classifier une observation.
L'inference bayesienne l'utilise pour quelque chose de plus general: mettre a jour une croyance
sur un parametre inconnu $\theta$ (un taux de conversion, un coefficient, une moyenne...) a mesure
que les donnees arrivent.
Le theoreme de Bayes version inference:
$$P(\theta \mid \text{donnees}) = \frac{P(\text{donnees} \mid \theta) \cdot P(\theta)}{P(\text{donnees})}$$
Chaque terme a un nom et un role:
- $P(\theta)$ = prior: ce que l'on croit sur $\theta$ AVANT de voir les donnees
(connaissance metier, etudes passees, ou ignorance assumee)
- $P(\text{donnees} \mid \theta)$ = vraisemblance: a quel point les donnees observees
sont plausibles pour chaque valeur possible de $\theta$
- $P(\theta \mid \text{donnees})$ = posterior: la croyance mise a jour, le resultat de l'inference
- $P(\text{donnees})$ = evidence: une constante de normalisation (elle ne depend pas de $\theta$)
La difference fondamentale avec l'approche classique:
| Approche | Le parametre __MATH_39d8dddd__ est... | Resultat de l'estimation |
|---|---|---|
| Frequentiste (modules 1 a 16) | une valeur fixe inconnue | un nombre (estimation ponctuelle) |
| Bayesienne | une variable aleatoire | une distribution entiere |
Au lieu de dire "le taux de conversion est 8.5%", on dira "le taux de conversion suit cette
distribution, centree sur 8.5%, avec 95% de chances d'etre entre 6% et 12%".
Toute l'incertitude est conservee et exploitable pour la decision.