码迷,mamicode.com
首页 > 编程语言 > 详细

cs231n spring 2017 lecture14 Reinforcement Learning 听课笔记

时间:2017-12-10 19:33:47      阅读:215      评论:0      收藏:0      [点我收藏+]

标签:isp   width   problem   style   lock   依赖   笔记   ima   auto   

(没太听明白,下次重新听)

1. 增强学习

  有一个 Agent 和 Environment 交互。在 t 时刻,Agent 获知状态是 st,做出动作是 at;Environment 一方面给出 Reward 信号 rt,另一方面改变状态至 st+1;Agent 获得 r和 st+1。目标是 Agent 学习 s到 a的某种映射 π* 最大化累积的 Reward,∑γtrt,其中 γ是折现系数(discount factor)。

技术分享图片

  用Markov Decision Process描述RL problem。马尔可夫过程是拥有马尔可夫性质的过程。马尔可夫性质:未来的状态仅依赖当前状态,或者说该过程没有记忆特质。

 

cs231n spring 2017 lecture14 Reinforcement Learning 听课笔记

标签:isp   width   problem   style   lock   依赖   笔记   ima   auto   

原文地址:http://www.cnblogs.com/zonghaochen/p/8017725.html

(0)
(0)
   
举报
评论 一句话评论(0
登录后才能评论!
© 2014 mamicode.com 版权所有  联系我们:gaon5@hotmail.com
迷上了代码!