刘旖菲
摘要:深度强化学习在可以手动设计奖励函数的领域取得了优异的效果。逆向强化学习利用专家演示数据推断奖励函数,可以有效解决强化学习的奖励函数设计困难的问题。为了全面反映逆向强化学习的研究进展,本文对国内外公开发表的具有代表性的论文进行了概述。本文首先介绍了逆向强化学习的简介,然后概述了逆向强化学习的研究进展,最后提出了逆向强化学习存在的问题以及未来的研究方向。
关键词:人工智能;深度学习;逆向强化学习
中图分类号:TP311 文献标识码:A
文章编号:1009-3044(2021)15-0190-02
近年来,强化学习在复杂问题的处理上取得了不错的效果。强化学习利用奖励函数表示优化目标,优化目标决定了智能体的所学策略的最终形式。但是,好的奖励函数的设计是困难的。一方面,奖励函数的设计具有主观性和经验性;另一方面,一些任务的奖励信号是稀疏的,无法用严格的理论知识推导奖励函数的设计。因此,奖励函数的设计是阻碍强化学习算法得到普遍应用的一个难点。
Ng等人提出[1],专家在完成某项任务时,其决策往往是最优的或接近最优的,当所有的策略产生的累积回报函数期望都不比专家策略产生的累積回报期望大时,强化学习所对应的回报函数就是根据示例学到的回报函数。通过逆向强化学习算法,智能体从专家的演示数据中推断出奖励函数,并利用该奖励函数学习策略,使得在该奖励函数下所学习的最优策略与专家的执行策略接近。……