逆向强化学习研究概述

2021-07-19 21:24:45刘旖菲
电脑知识与技术 2021年15期
关键词:深度学习人工智能

刘旖菲

摘要:深度强化学习在可以手动设计奖励函数的领域取得了优异的效果。逆向强化学习利用专家演示数据推断奖励函数,可以有效解决强化学习的奖励函数设计困难的问题。为了全面反映逆向强化学习的研究进展,本文对国内外公开发表的具有代表性的论文进行了概述。本文首先介绍了逆向强化学习的简介,然后概述了逆向强化学习的研究进展,最后提出了逆向强化学习存在的问题以及未来的研究方向。

关键词:人工智能;深度学习;逆向强化学习

中图分类号:TP311      文献标识码:A

文章编号:1009-3044(2021)15-0190-02

近年来,强化学习在复杂问题的处理上取得了不错的效果。强化学习利用奖励函数表示优化目标,优化目标决定了智能体的所学策略的最终形式。但是,好的奖励函数的设计是困难的。一方面,奖励函数的设计具有主观性和经验性;另一方面,一些任务的奖励信号是稀疏的,无法用严格的理论知识推导奖励函数的设计。因此,奖励函数的设计是阻碍强化学习算法得到普遍应用的一个难点。

Ng等人提出[1],专家在完成某项任务时,其决策往往是最优的或接近最优的,当所有的策略产生的累积回报函数期望都不比专家策略产生的累積回报期望大时,强化学习所对应的回报函数就是根据示例学到的回报函数。通过逆向强化学习算法,智能体从专家的演示数据中推断出奖励函数,并利用该奖励函数学习策略,使得在该奖励函数下所学习的最优策略与专家的执行策略接近。……

登录APP查看全文

猜你喜欢
深度学习人工智能
我校新增“人工智能”本科专业
人工智能与就业
IT经理世界(2018年20期)2018-10-24 02:38:24
数读人工智能
小康(2017年16期)2017-06-07 09:00:59
有体验的学习才是有意义的学习
电子商务中基于深度学习的虚假交易识别研究
现代情报(2016年10期)2016-12-15 11:50:53
MOOC与翻转课堂融合的深度学习场域建构
大数据技术在反恐怖主义中的应用展望
深度学习算法应用于岩石图像处理的可行性研究
软件导刊(2016年9期)2016-11-07 22:20:49
基于深度卷积网络的人脸年龄分析算法与实现
软件工程(2016年8期)2016-10-25 15:47:34
下一幕,人工智能!
南风窗(2016年19期)2016-09-21 16:51:29