Monte-carlo update:游戏开端后, 要等待游戏停止, 然后再总结这一回合中的所有转折点, 再更新行动准则。
Temporal-difference update:在游戏进行中每一步都在更新, 不消等待游戏的停止, 如许就能边玩边进修了。
On-policy:必须本人在场, 并且必定是本人边玩边进修。
Off-policy:可以选择本身玩, 也可以选择看着别人玩, 经由过程看别人玩来进修别人的行动准则。
重要算法有下面几种,今天先只是简述:
1. Sarsa

Q 为动作效用函数(action-utility function),用于评价在特定状况下采取某个动作的好坏,可以将之懂得为智能体(Agent)的大年夜脑。
SARSA 应用马尔科夫性质,只应用了下一步信息, 让体系按照策略指引进行摸索,在摸索每一步都进行状况价值的更新,更新公式如下所示:
在序列第一次碰着或者每次碰着一个状况 s 时,寂?驿衰减嘉奖:

s 为当缁ご态,a 是当前采取的动作,s’ 为下一步状况,a’ 是下一?状况采取的动作,r 是体系获得的嘉奖, α 是进修率, γ 是衰减因子。
2. Q learning


Q Learning 的算法框架和 SARSA 类似, 也是让体系按照策略指引进行摸索,在摸索每一步都进行状况价值的更新。关键在于 Q Learning 和 SARSA 的更新公式不一样,Q Learning 的更新公式如下:

3. Policy Gradients
体系会年腋荷琐固定或者随机肇端状况出发,策略梯度让体系摸索情况,生成一个大年夜肇端状况到终止状况的状况-动作-嘉奖序列,s1,a1,r1,.....,sT,aT,rT,在第 t 时刻,我们让 gt=rt+γrt+1+... 等于 q(st,a) ,大年夜而求解策略梯度优化问题。
4. Actor-Critic

算法分为两个部分:Actor 和 Critic。Actor 更新策略, Critic 更新价值。Critic 就可以用之前介绍的 SARSA 或者 Q Learning 算法。
5. Monte-carlo learning
用当前策略摸索产生一个完全的状况-动作-嘉奖序列:
s1,a1,r1,....,sk,ak,rk~π

最后更新状况价值:

6. Deep-Q-Network

应用举例
DQN 算法的重要做法是 Experience Replay,将体系摸索情况获得的数据储存起来,然后随机采样样本更新深度神经收集的参数。它也是在每个 action 和 environment state 下达到最大年夜回报,不合的是加了一些改进,参加了经验回放和决战收集架构。
https://www.zhihu.com/question/41775291

强化进修有很多应用,除了无人驾驶,AlphaGo,玩游戏之外,还有下面这些工程中实用的例子:
1. Manufacturing
例如一家日本公司 Fanuc,工厂机械人在拿起一个物体时,会捕获这个过程的视频,记住它每次操作的行动,操作成功照样掉败了,积聚经验,下一次可以更快更准地采取行动。

2. Inventory Management
在库存治理中,因为库存量大年夜,库存需求波动较大年夜,库存补货速度迟缓等阻碍使得治理是个比较难的问题,可以经由过程建立强化进修算法来削减库存周转时光,进步空间应用率。
3. Dynamic pricing
制造商在向各个客户运输时,想要在知足客户的所有需求的同时降低车队总成本。经由过程 multi-agents 体系和 Q-learning,可以降低时光,削减车辆数量。
5. ECommerce Personalization
在电商中,也可以用强化进修算法来进修和分析顾客行动,定制产品和办事以知足客户的个性化需求。
6. Ad Serving
例如算法 LinUCB (属于强化进修算法 bandit 的一种算法),会测验测验投放更广范围的告白,尽管以前还没有被浏览很多,可以或许更好地估计真实的点击率。
推荐阅读
【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路! 捷报道, Qrativ公司将结合 nference 基于 AI 的常识综合平台与梅奥诊所世界有名的医疗专业常识和临床数据>>>详细阅读
本文标题:开发者自述:我是这样理解强化学习的
地址:http://www.17bianji.com/lsqh/36264.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示