Policy based:经由过程感官分析所处的情况, 直接输出下一步要采取的各类动作的概率, 然后根据概率采取行动。
Value based:输出的是所有动作的价值, 根据最高价值来选动作,这类办法不克不及选掏出续的动作。
应用举例
1. 定义
Monte-carlo update:游戏开端后, 要等待游戏停止, 然后再总结这一回合中的所有转折点, 再更新行动准则。
Temporal-difference update:在游戏进行中每一步都在更新, 不消等待游戏的停止, 如许就能边玩边进修了。
On-policy:必须本人在场, 并且必定是本人边玩边进修。
Off-policy:可以选择本身玩, 也可以选择看着别人玩, 经由过程看别人玩来进修别人的行动准则。
重要算法有下面几种,今天先只是简述:
1. Sarsa

Q 为动作效用函数(action-utility function),用于评价在特定状况下采取某个动作的好坏,可以将之懂得为智能体(Agent)的大年夜脑。
SARSA 应用马尔科夫性质,只应用了下一步信息, 让体系按照策略指引进行摸索,在摸索每一步都进行状况价值的更新,更新公式如下所示:

s 为当缁ご态,a 是当前采取的动作,s’ 为下一步状况,a’ 是下一?状况采取的动作,r 是体系获得的嘉奖, α 是进修率, γ 是衰减因子。
在库存治理中,因为库存量大年夜,库存需求波动较大年夜,库存补货速度迟缓等阻碍使得治理是个比较难的问题,可以经由过程建立强化进修算法来削减库存周转时光,进步空间应用率。
2. Q learning


Q Learning 的算法框架和 SARSA 类似, 也是让体系按照策略指引进行摸索,在摸索每一步都进行状况价值的更新。关键在于 Q Learning 和 SARSA 的更新公式不一样,Q Learning 的更新公式如下:

3. Policy Gradients
体系会年腋荷琐固定或者随机肇端状况出发,策略梯度让体系摸索情况,生成一个大年夜肇端状况到终止状况的状况 - 动作 - 嘉奖序列,s1,a1,r1,.....,sT,aT,rT,在第 t 时刻,我们让 gt=rt+γrt+1+... 等于 q(st,a) ,大年夜而求解策略梯度优化问题。
4. Actor-Critic

算法分为两个部分:Actor 和 Critic。Actor 更新策略, Critic 更新价值。Critic 就可以用之前介绍的 SARSA 或者 Q Learning 算法。
5. Monte-carlo learning
用当前策略摸索产生一个完全的状况 - 动作 - 嘉奖序列:
s1,a1,r1,....,sk,ak,rk∼π
在序列第一次碰着或者每次碰着一个状况 s 时,寂?驿衰减嘉奖:

最后更新状况价值:

6. Deep-Q-Network


4. 应用举例
强化进修有很多应用,除了无人驾驶,AlphaGo,玩游戏之外,还有下面这些工程中实用的例子:
5. ECommerce Personalization
1. Manufacturing
例如一家日本公司 Fanuc,工厂机械人在拿起一个物体时,会捕获这个过程的视频,记住它每次操作的行动,操作成功照样掉败了,积聚经验,下一次可以更快更准地采取行动。
经由过程强化进修,一个 agent 可以在摸索和开辟(exploration and exploitation)之间做衡量,并且选择一个最大年夜的回报。

3. Dynamic pricing
强化进修中的 Q-learning 可以用来处理动态订价问题。
DQN 算法的重要做法是 Experience Replay,将体系摸索情况获得的数据储存起来,然后随机采样样本更新深度神经收集的参数。它也是在每个 action 和 environment state 下达到最大年夜回报,不合的是加了一些改进,参加了经验回放和决战收集架构。
推荐阅读
7月22日,"2017家当园区融合成长与园区聪明化岑岭论坛"在京举办,来自家当园区开辟扶植、运营治理、投融资、聪明园区等范畴的与会代表近200人参加了本次论坛晃荡。【编辑推荐】物联网开放>>>详细阅读
本文标题:从概念到应用,全面了解强化学习
地址:http://www.17bianji.com/lsqh/36404.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示