Wikiwand AI

Surapprentissage

notion statistique From Wikipedia, the free encyclopedia

En statistique, le surapprentissage, ou surajustement ou encore surinterprétation, est une analyse statistique qui correspond trop précisément à une collection particulière d'un ensemble de données. Ainsi, cette analyse peut ne pas correspondre à des données supplémentaires ou ne pas prévoir de manière fiable les observations futures. Un modèle surajusté est un modèle statistique qui contient plus de paramètres que ne peuvent le justifier les données[1].

La ligne verte représente un modèle surappris et la ligne noire représente un modèle régulier. La ligne verte classifie trop parfaitement les données d'entrainement, elle généralise mal et donnera de mauvaises prévisions futures avec de nouvelles données. Le modèle vert est donc finalement moins bon que le noir.

Apprentissage automatique

Le problème existe aussi en apprentissage automatique [2]. Il est en général provoqué par un mauvais dimensionnement de la structure utilisée pour classifier ou faire une régression. De par sa trop grande capacité à capter des informations, une structure dans une situation de surapprentissage aura de la peine à généraliser les caractéristiques des données. Elle se comporte alors comme une table contenant tous les échantillons utilisés lors de l'apprentissage et perd ses pouvoirs de prédiction sur de nouveaux échantillons.

Illustration

Le surapprentissage s'interprète comme un apprentissage « par cœur » des données, un genre de mémorisation. Il résulte souvent d'une trop grande liberté dans le choix du modèle.

La figure ci-dessous illustre ce phénomène dans le cas d'une régression dans .

Les points verts sont correctement décrits par une régression linéaire.

Si l'on autorise un ensemble de fonctions d'apprentissage plus grand, par exemple l'ensemble des fonctions polynomiales à coefficients réels, il est possible de trouver un modèle décrivant parfaitement les données d'apprentissage (erreur d'apprentissage nulle). C'est le cas du polynôme d'interpolation de Lagrange : il passe bien par tous les points verts mais n'a visiblement aucune capacité de généralisation.

En vert, les points de l'ensemble d'apprentissage et une régression linéaire sur ces points. En rouge, les points de l'ensemble de test. En bleu, le polynôme d'interpolation de Lagrange a une erreur d'apprentissage nulle mais est fortement affecté par le bruit de l'ensemble d'apprentissage et échoue à en dégager les caractéristiques.

Éviter le surapprentissage

Voir aussi

Related Articles

Timelines

Top Qs

Fact Checks