Pas encore de compte ?
En apprentissage par renforcement, une méthode du gradient de politique est un algorithme qui apprend une politique directement en s'intéressant directement à la celle-ci.
La méthode du gradient de politique permet l'optimisation de la politique paramétrée par rapport au rendement attendu avec la méthode de descente des gradients.
À la fin d'un certain nombre d'itérations, l'objectif est d'obtenir une maximisation de la performance de la politique pour un modèle étudié.
Les méthodes du gradient de politique s'opposent donc aux méthodes value-based qui optimisent des valeurs pour ensuite définir la politique optimale pour ces valeurs.
Bienvenu, je m’appelle Eric Soupet et je suis l'administrateur du site elodees.com. elodees.com est un état de l'art de l'Intelligence Artificielle et se veut collaboratif, vous pouvez dès à présent proposer du contenu tels que des articles, des événements, des tutoriels, ... alors n'hésitez pas !
Crédit des images de la plate-forme : Pixabay - Pixabay License | Pexels - Pexels License