码迷,mamicode.com
首页 > 移动开发 > 详细

Policy-based Approach(基于策略的方法)

时间:2020-02-28 19:00:05      阅读:106      评论:0      收藏:0      [点我收藏+]

标签:neu   style   16px   cto   ima   image   好的   gradient   ESS   

技术图片

 

 

 

 技术图片

技术图片

 

step 1:Neural Network as Actor

技术图片

 

 

step 2:goodness of function(训练一些Actor)

技术图片是一个序列,包含T个状态s、行为a、奖励s。代表某一次的开始到结束的过程。

技术图片是一个奖励和。

技术图片是某一设定好的参数技术图片获得的总平均奖励

 用策略技术图片去玩N次游戏获得N个技术图片,则从概率技术图片中进行采样。

技术图片

 

 

 

 

 

 step 3:pick the best function(找到最好的一个Actor)

 方法:Gradient Ascent

即最大化技术图片,用Gradient Ascent方法寻找使技术图片最大的技术图片

 技术图片

 

 

 技术图片

 

 技术图片

技术图片

技术图片

 

添加偏置

这里的技术图片有可能总是正数,加上一个偏置b即可。

如果相减还是得到一个正数则可以提高该行为的概率,否则降低该行为的概率

技术图片

 

Policy-based Approach(基于策略的方法)

标签:neu   style   16px   cto   ima   image   好的   gradient   ESS   

原文地址:https://www.cnblogs.com/phonard/p/12378148.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!