← IAOC — roadmap
Module 13/Avance
Apprentissage par renforcement
Apprendre par l'interaction : agent, environnement, récompense. La famille d'approches qui pilote un robot ou un système autonome.
·/5 cours
155 min260 min360 min460 min555 min
Le cadre du renforcement
Agent, environnement, état, action, récompense, politique, processus de décision markovien, horizon et facteur d'actualisation.
Fonctions de valeur et programmation dynamique
Valeur d'état et d'action, équations de Bellman, itération sur les valeurs et sur les politiques.
Méthodes sans modèle
Monte-Carlo, différences temporelles, Q-learning, SARSA, politiques epsilon-gloutonnes.
Renforcement profond
Approximation par réseau de neurones, Deep Q-Network, rejeu d'expérience, méthodes acteur-critique, instabilités.
Applications à la robotique et aux systèmes autonomes
Contrôle d'un actionneur, simulation avant déploiement, écart simulation-réalité, sécurité de fonctionnement.