亲爱的研友该休息了!由于当前在线用户较少,发布求助请尽量完整地填写文献信息,科研通机器人24小时在线,伴您度过漫漫科研夜!身体可是革命的本钱,早点休息,好梦!

A novel multi-step Q-learning method to improve data efficiency for deep reinforcement learning

计算机科学 强化学习 增强学习 人工智能 机器学习
作者
Yi Yuan,Zhu Liang Yu,Zhenghui Gu,Yao Yeboah,Wei Wu,Xinyang Deng,Yuanqing Li
出处
期刊:Knowledge Based Systems [Elsevier BV]
卷期号:175: 107-117 被引量:33
标识
DOI:10.1016/j.knosys.2019.03.018
摘要

Deep reinforcement learning (DRL) algorithms with experience replays have been used to solve many sequential learning problems. However, in practice, DRL algorithms still suffer from the data inefficiency problem, which limits their applicability in many scenarios, and renders them inefficient in solving real-world problems. To improve the data efficiency of DRL, in this paper, a new multi-step method is proposed. Unlike traditional algorithms, the proposed method uses a new return function, which alters the discount of future rewards while decreasing the impact of the immediate reward when selecting the current state action. This approach has the potential to improve the efficiency of reward data. By combining the proposed method with classic DRL algorithms, deep Q-networks (DQN) and double deep Q-networks (DDQN), two novel algorithms are proposed for improving the efficiency of learning from experience replay. The performance of the proposed algorithms, expected n-step DQN (EnDQN) and expected n-step DDQN (EnDDQN), are validated using two simulation environments, CartPole and DeepTraffic. The experimental results demonstrate that the proposed multi-step methods greatly improve the data efficiency of DRL agents while further improving the performance of existing classic DRL algorithms when incorporated into their training.

科研通智能强力驱动
Strongly Powered by AbleSci AI
科研通是完全免费的文献互助平台,具备全网最快的应助速度,最高的求助完成率。 对每一个文献求助,科研通都将尽心尽力,给求助人一个满意的交代。
实时播报
复杂惜珊完成签到,获得积分10
3秒前
小巧的傲晴完成签到,获得积分10
31秒前
今后应助科研通管家采纳,获得10
57秒前
一只不受管束的小狸Miao完成签到 ,获得积分10
1分钟前
taku完成签到 ,获得积分0
1分钟前
单纯的天抒完成签到,获得积分10
1分钟前
1分钟前
suxiaosi完成签到 ,获得积分10
1分钟前
搜集达人应助四季采纳,获得30
1分钟前
丢丢小皮蛋完成签到,获得积分10
2分钟前
高高的夏波完成签到,获得积分10
2分钟前
大个应助科研通管家采纳,获得10
2分钟前
Sjejj完成签到 ,获得积分10
3分钟前
hhdr完成签到 ,获得积分10
3分钟前
知知完成签到,获得积分10
3分钟前
何同学完成签到,获得积分10
3分钟前
辣椒油完成签到,获得积分20
3分钟前
Sunvo完成签到,获得积分10
3分钟前
单身的曲奇完成签到,获得积分10
3分钟前
酷波er应助123456hhh采纳,获得10
3分钟前
4分钟前
深情安青应助酷酷海豚采纳,获得10
4分钟前
辣椒油发布了新的文献求助10
4分钟前
SJJ完成签到 ,获得积分10
4分钟前
rrrrrr完成签到 ,获得积分10
4分钟前
4分钟前
4分钟前
4分钟前
小咪哦哦发布了新的文献求助10
4分钟前
酷酷海豚发布了新的文献求助10
4分钟前
年轻火车完成签到,获得积分10
4分钟前
抚琴祛魅完成签到 ,获得积分10
4分钟前
YAN发布了新的文献求助10
4分钟前
4分钟前
4分钟前
4分钟前
htttt发布了新的文献求助10
4分钟前
是椰发布了新的文献求助10
4分钟前
聚义发布了新的文献求助10
4分钟前
乐乐应助辣椒油采纳,获得10
5分钟前
高分求助中
Markov Chain Monte Carlo 10000
(应助此贴封号)【重要!!请各用户(尤其是新用户)详细阅读】【科研通的精品贴汇总】 10000
Common Foundations of American and East Asian Modernisation: From Alexander Hamilton to Junichero Koizumi 2000
Advanced Weaponeering Fourth Edition, Volume 2 1000
Weaponeering: An Introduction Fourth Edition, Volume 1 1000
悉尼大学博士学位论文,题目:Modelling and testing of one-sided stitched laminated composites. 作者:Kristopher P. Plain 700
Matrix Methods in Data Mining and Pattern Recognition Second Edition 610
热门求助领域 (近24小时)
化学 材料科学 医学 生物 纳米技术 工程类 有机化学 化学工程 生物化学 计算机科学 内科学 物理 复合材料 催化作用 细胞生物学 无机化学 光电子学 物理化学 电极 基因
热门帖子
关注 科研通微信公众号,转发送积分 7549467
求助须知:如何正确求助?哪些是违规求助? 9132323
关于积分的说明 19512878
捐赠科研通 7142223
什么是DOI,文献DOI怎么找? 3259993
关于科研通互助平台的介绍 2426672
邀请新用户注册赠送积分活动 2248767