毛国君,顾世民
(福建工程学院 机器学习与智能科学研究所,福州 350118)
人类知识的获取是通过感知环境(Environment)并与之交互来完成的,因此所谓的智能学习就是智能体(Agent)不断适应环境来完善自己的过程。强化学习(reinforcement learning,RL)是机器学习的方法论之一,用于描述和解决智能体在与环境的交互过程中如何学习和优化策略的问题[1]。事实上,许多应用中的环境是动态变化和不确定性的,如机器人的路径规划问题,智能体必须在不确定性环境中主动地对周围环境进行探索[2-3]。在探索过程中不断地认知环境,形成适应环境的正确行为。
强化学习不同于目前广泛研究的监督学习(supervised learning)和无监督学习(unsupervised learning),它的学习不是被动地从已有数据中进行归纳或提取,而是一个主动适应环境并进行自我完善的过程。强化学习是从计算机科学、数学、神经学等多个相关学科发展而来的,已经成为机器学习的主要分支之一[4-5]。由于强化学习强调在环境变化情况下智能体的主动学习,因此近年受到广泛关注,并在机器人控制以及智能计算等领域得到应用。
基本的强化学习思想是通过智能体对当前环境状态的感知,并对可能采取的动作(Action)获得的回报(Reward))进行评价来完成的。图1给出了强化学习的基本模型[6]。

图1 强化学习的基本模型Fig.1 Reinforcement learning model
强化学习是一个“探索-利用”的迭代过程[6-7]。首先,智能体通过感知环境的当前状态,并采取某一个动作来探索环境,探索的结果一般以某种形式的奖励或者回报来表示。……