发帖

楼主: DL-er

723 0

一种近似模型表示的启发式Dyna优化算法 [推广有奖]

0关注
6粉丝

会员

学术权威

74%

还不是VIP/贵宾

-

0%

威望: 0 级
论坛币: 15 个
通用积分: 1.0435
学术水平: 0 点
热心指数: 0 点
信用等级: 0 点
经验: 38540 点
帖子: 3853
精华: 0
在线时间: 813 小时
注册时间: 2017-9-5
最后登录: 2018-6-30

楼主

DL-er

发表于 2018-1-2 10:20:01 |AI写论文

是否 +2 论坛币

k人参与回答

经管之家送您一份

应届毕业生专属福利!

求职就业群

赵安豆老师微信：zhaoandou666

经管之家联合CDA

送您一个全额奖学金名额~ !

立即领取

感谢您参与论坛问题回答

经管之家送您两个论坛币！

+2 论坛币

摘要：针对基于查询表的Dyna优化算法在大规模状态空间中收敛速度慢、环境模型难以表征以及对变化环境的学习滞后性等问题,提出一种新的基于近似模型表示的启发式Dyna优化算法（a heuristic Dyna optimization algorithm using approximate model representation,HDyna-AMR）,其利用线性函数近似逼近Q值函数,采用梯度下降方法求解最优值函数.HDyna-AMR算法可以分为学习阶段和规划阶段.在学习阶段,利用agent与环境的交互样本近似表示环境模型并记录特征出现频率;在规划阶段,基于近似环境模型进行值函数的规划学习,并根据模型逼近过程中记录的特征出现频率设定额外奖赏.从理论的角度证明了HDyna-AMR的收敛性.将算法用于扩展的Boyan chain问题和Mountain car问题.实验结果表明,HDyna-AMR在离散状态空间和连续状态空间问题中能学习到最优策略,同时与Dyna-LAPS（Dyna-style planning with linear approximation and prioritized sweeping）和Sarsa（λ）相比,HDyna-AMR具有收敛速度快以及对变化环境的近似模型修正及时的优点.

原文链接:http://www.cqvip.com//QK/94913X/201512/667210344.html

送人玫瑰，手留余香~如您已下载到该资源，可在回帖当中上传与大家共享，欢迎来CDA社区交流学习。（仅供学术交流用。）

扫码加我拉你入群

请注明：姓名-公司-职位

以便审核进群资格，未注明则拒绝

分享0 收藏0 回帖

关键词：启发式 Presentation Optimization Presentatio Approximate 强化学习模型学习规划函数逼近机器学习

一种近似模型表示的启发式Dyna优化算法 [推广有奖]

经管之家送您一份

经管之家联合CDA

感谢您参与论坛问题回答

扫码加我拉你入群

相关帖子

浏览过的帖子

浏览过的版块

本版微信群

一种近似模型表示的启发式Dyna优化算法 [推广有奖]

经管之家送您一份

经管之家联合CDA

感谢您参与论坛问题回答

扫码加我 拉你入群

相关帖子

浏览过的帖子

浏览过的版块

本版微信群

扫码加我拉你入群