Renforcement de l'apprentissage
Apprendre par machine pour des décisions séquentielles dans lesquelles un agent améliore le comportement à partir de récompenses générées par l'interaction.
- Revision
- 1
- Created by
- SCIENDIA Knowledge Desk
- Updated by
- SCIENDIA Knowledge Desk
- Last updated
- 18.08.2026 12:20
Built by the community
Members can improve this article. Every saved change remains visible in the revision ledger.
Aperçu général
Le renforcement de l'apprentissage modèle un agent agissant dans un environnement où les choix affectent les états futurs et les résultats retardés. L'objectif est une politique qui maximise la récompense cumulative attendue plutôt que la précision de prédiction en une seule étape.
Fondations techniques
Un processus décisionnel de Markov suppose que l'état actuel contient les informations nécessaires pour prévoir les futures transitions en fonction d'une action. Les équations de Bellman relient récursivement la valeur à la récompense immédiate et à la valeur qui lui succède. Les méthodes de différence temporelle sont des estimations de base; l'apprentissage Q est hors politique, alors que l'ASRA suit la politique de comportement. Les gradients de politiques utilisent les rapports de probabilité pour optimiser les politiques stochastiques, et les méthodes acteur-critique réduisent les écarts avec les valeurs de référence apprises. L'observabilité partielle nécessite des états de mémoire ou de croyance, tandis que le contrôle continu utilise l'approximation des fonctions et des mises à jour politiques soigneusement régularisées.
Comment ça marche
Un processus de décision Markov spécifie les états, les actions, les transitions, les récompenses et les rabais. Les méthodes de valeur estiment le rendement à long terme, les méthodes de graduation des politiques optimisent les probabilités d'action directement et les systèmes de critique des acteurs combinent les deux. L'exploration recueille des informations mais peut entraîner des coûts réels.
Méthodes de mesure et de recherche
Moyennes d'évaluation pour les semences et rapports sur les courbes d'apprentissage, les interactions environnementales et le budget d'ajustement. Le renforcement hors ligne des formations à partir de données fixes enregistrées et doit éviter les actions non soutenues par ces données; l'échantillonnage d'importance, des objectifs prudents et l'incertitude du modèle traitent du changement de distribution. Les systèmes Sim-to-Real randomisent la physique et étalonnent les capteurs, puis imposent des contraintes de sécurité pendant le transfert. L'audit de la récompense permet de vérifier l'exploitation par procuration et l'évaluation hors politique contrefaite exige des hypothèses sur les propensions à l'exploitation forestière. Les études humaines distinguent le succès des tâches de la préférence, de la charge de travail et de l'adaptation non intentionnelle.
Idées clés
- La conception de récompense précise la tâche imparfaite et peut être exploitée.
- Les données hors politique doivent être corrigées lorsque les comportements et les politiques cibles diffèrent.
- La performance de simulation ne garantit pas un contrôle sûr du monde réel.
Frontière actuelle de la recherche
La frontière comprend la planification basée sur des modèles, les compétences hiérarchiques, l'interaction multi-agents et le renforcement de l'apprentissage à partir de la rétroaction humaine ou machine. Les modèles mondiaux compressent la dynamique pour les déploiements imaginaires mais peuvent être exploités là où l'erreur de prédiction est élevée. L'exploration sécuritaire vise à obtenir des garanties de performance sous des contraintes, et des méthodes robustes tiennent compte des transitions contradictoires ou incertaines. Les problèmes ouverts incluent l'affectation de crédit à une longue période, l'apprentissage continu et la généralisation reproductible à de nouvelles tâches. Le déploiement à fort coefficient exige un contrôle, une surveillance et des limites d'autorité au-delà de la politique apprise par un agent.
Pourquoi ça compte
L'apprentissage renforcé soutient les jeux, la robotique, le contrôle des ressources et l'expérimentation adaptative. Il fournit des outils formels pour équilibrer les conséquences immédiates et différées.
Limites et questions ouvertes
L'inefficacité des échantillons, le décalage de distribution et la faible rétroaction rendent la formation instable. Les contraintes de sécurité, l'observation partielle et les préférences humaines compliquent le déploiement, et les gains signalés peuvent dépendre fortement des semences, des simulateurs ou des informations privilégiées sur l'état.
Explore through connected concepts
This article is indexed with 20 technical tags. Select a tag to explore the Wiki by concept.