加强学习
机器学习,以便进行连续决策。 在这种决定中代理人通过互动产生的奖励改善行为方式;
- Revision
- 1
- Created by
- SCIENDIA Knowledge Desk
- Updated by
- SCIENDIA Knowledge Desk
- Last updated
- 18.08.2026 12:20
Built by the community
Members can improve this article. Every saved change remains visible in the revision ledger.
概览
强化学习模式,一种在选择影响未来状态和延迟结果的环境中发挥作用的代理人。 目标是实行最大限度地提高预期累积奖励而不是一步步预测准确性的政策。
技术基础
马尔科夫决定程序假定当前状态包含预测未来过渡所需信息,以给出行动. 贝尔曼方程将价值与即时奖励和后继价值观相接而来. 时间差异法是“诱饵”估计;Q学习不是政策,而SARSA遵循行为策略。 政策梯度使用概率比率来优化有条理的政策,而行为者-批评方法减少了与所学价值基线的差异。 部分可观察性需要内存或信念状态,而连续控制则使用函数近似并仔细地规范化的政策更新.
如何运作
马尔科夫决定程序规定了状态,行动、过渡和奖励以及折扣. 价值方法估计长期回报,政策分级法直接优化动作概率和演员-批评系统结合. 勘探收集信息,但可能带来实际成本。
衡量和研究方法
评估平均数涉及种子和报告学习曲线、环境互动和调整预算。 固定记录数据的离线强化学习列车,必须避免该数据不支持的行动;重要性取样、保守目标和模型不确定性解决分布转移问题。 由Sim-to现实系统随机化物理和校正传感器,再在转移过程中执行安全约束. 奖励审计检验代理开采,反事实政策外评价要求假设伐木倾向。 人类研究将任务的成功与偏好、工作量和意外适应区分开来。
二. 主要想法
- 奖励设计不完美地规定了任务,可以加以利用。
- 在行为和目标政策不同时,需要纠正非政策的出错数据。
- 模拟性能并不能保证安全的真实世界控制.
目前的研究领域
前沿包括基于模型的规划,分级技能、多代理互动和从人或机器反馈中学习强化。 世界模型压缩了预期推出的动力,但可以在预测出错高的地方加以利用。 安全勘探寻求在制约下提供履约保证,而强健的方法则反映了对抗性或不确定的过渡。 公开的问题包括长期信贷分配、持续学习和可再生产地概括到新任务。 高收量部署需要反向控制、监测和权力限制,超出代理人的已学习政策。
为什么它很重要
强化学习支持游戏,机器人学等资源控制和适应性实验. 它为平衡眼前和延迟的后果提供了正式的工具。
限制和未决问题
效率低下、分配转移和反馈很少,使得培训不稳定。 安全限制、部分观察和人类偏好使部署复杂化,所报告的收益可能严重地取决于种子或模拟器或者特殊国家信息。
Explore through connected concepts
This article is indexed with 20 technical tags. Select a tag to explore the Wiki by concept.