Pas encore de compte ?
L'apprentissage par différence temporelle fait référence à une classe de méthodes d'apprentissage par renforcement sans modèle qui apprennent en s'amorçant à partir de l'estimation actuelle de la fonction de valeur.
Ces méthodes échantillonnent à partir de l'environnement comme les méthodes de Monte Carlo et effectuent des mises à jour basées sur les estimations actuelles comme les méthodes de programmation dynamique.
Alors que les méthodes de Monte Carlo n'ajustent leurs estimations qu'une fois le résultat final connu les méthodes de la différence temporelle ajustent les prédictions pour qu'elles correspondent à des prédictions ultérieures plus précises sur l'avenir avant que le résultat final ne soit connu.
Bienvenu, je m’appelle Eric Soupet et je suis l'administrateur du site elodees.com. elodees.com est un état de l'art de l'Intelligence Artificielle et se veut collaboratif, vous pouvez dès à présent proposer du contenu tels que des articles, des événements, des tutoriels, ... alors n'hésitez pas !
Crédit des images de la plate-forme : Pixabay - Pixabay License | Pexels - Pexels License