《電子技術應用》
您所在的位置:首頁 > 其他 > 设计应用 > 联合随机性策略的深度强化学习探索方法
联合随机性策略的深度强化学习探索方法
信息技术与网络安全
杨尚彤,王子磊
(中国科学技术大学 网络空间安全学院,安徽 合肥230027)
摘要: 目前深度强化学习算法已经可以解决许多复杂的任务,然而如何平衡探索和利用的关系仍然是强化学习领域的一个基本的难题,为此提出一种联合随机性策略的深度强化学习探索方法。该方法利用随机性策略具有探索能力的特点,用随机性策略生成的经验样本训练确定性策略,鼓励确定性策略在保持自身优势的前提下学会探索。通过结合确定性策略算法DDPG和提出的探索方法,得到基于随机性策略指导的确定性策略梯度算法(SGDPG)。在多个复杂环境下的实验表明,面对探索问题,SGDPG的探索效率和样本利用率要优于DDPG算法。
中圖分類號: TP18
文獻標識碼: A
DOI: 10.19358/j.issn.2096-5133.2021.06.008
引用格式: 楊尚彤,王子磊. 聯合隨機性策略的深度強化學習探索方法[J].信息技術與網絡安全,2021,40(6):43-49.
Efficient exploration with stochastic policy for deep reinforcement learning
Yang Shangtong,Wang Zilei
(School of Cyberspace Security,University of Science and Technology of China,Hefei 230027,China)
Abstract: At present, deep reinforcement learning algorithms have been shown to solve many complex tasks, but how to balance the relationship between exploration and exploitation is still a basic problem. Thus, this paper proposes an efficient exploration strategy combined with stochastic policy for deep reinforcement learning. The main contribution is to use the experience generated by stochastic policies to train deterministic policies, which encourages deterministic strategies to learn to explore while maintaining their own advantages. This takes advantage of the exploration ability of stochastic policies. By combining DDPG(Deep Deterministic Policy Gradient) and the proposed exploration method, the algorithm called stochastic guidance for deterministic policy gradient(SGDPG) is obtained. Finally, the results of the experiment in several complex environments show that SGDPG has higher exploration and sample efficiency than DDPG when faced with deep exploration problems.
Key words : reinforcement learning;deep reinforcement learning;exploration-exploitation dilemma

 0 引言

目前,強化學習(reinforcement learning)作為機器學習領域的一個研究熱點,已經在序列決策問題中取得了巨大的進步,廣泛應用于游戲博弈[1]、機器人控制[2]、工業應用[3]等領域。近年來,許多強化學習方法利用神經網絡來提高其性能,于是有了一個新的研究領域,被稱為深度強化學習(Deep Reinfor-

cement Learning,DRL)[4]。但是強化學習仍然面臨一個主要的問題:探索利用困境(exploration-exploitation dilemma)。在智能體學習過程中,探索(exploration)意味著智能體嘗試之前沒有做過的動作,有可能獲得更高的利益,而利用(exploitation)是指智能體根據之前的經驗選擇當前最優的動作。目前,深度強化學習方法的研究主要集中在結合深度學習提高強化學習算法的泛化能力,如何有效地探索狀態空間仍然是一個關鍵的挑戰。




本文詳細內容請下載:http://www.tom3567.com/resource/share/2000003599




作者信息:

楊尚彤,王子磊

(中國科學技術大學 網絡空間安全學院,安徽 合肥230027)


此內容為AET網站原創,未經授權禁止轉載。
主站蜘蛛池模板: 日韩一区免费观看| 欧美日韩在线观看一区| 日韩在线视频观看| 涩涩日韩在线| 亚洲欧美日韩精品久久久| 久久久国产影院| 亚洲人成网站在线播放2019| 亚洲午夜精品久久久久久人妖| 五月婷婷一区| 国产精品美女久久| 国产精品美女久久久久久免费| 国产福利久久精品| 久久精品国产亚洲精品2020| wwwwww欧美| 国产精品美女久久久久av超清| 久久五月天婷婷| 日本精品国语自产拍在线观看 | 亚洲综合国产精品| 久久久综合av| 欧美激情亚洲精品| 国产成人精品电影久久久| 亚洲一区三区在线观看| 精品99在线视频| 日韩在线视频中文字幕| 国产精品免费在线免费| 国产欧美日韩丝袜精品一区| 久久av免费一区| 国产精品美女久久| 日韩三级在线播放| 久久久无码中文字幕久...| 韩国v欧美v日本v亚洲| 精品人妻一区二区三区四区在线 | 日本高清久久天堂| 国产精品盗摄久久久| www国产精品com| 国产不卡一区二区在线观看| 激情五月综合色婷婷一区二区| 国产精品久久精品视| 国产精品视频网站在线观看| 国产www精品| 日韩精品视频一区二区在线观看|