作家
登录

开发者自述:我是这样理解强化学习的

作者: 来源: 2017-07-18 11:58:28 阅读 我要评论

Monte-carlo update:游戏开端后, 要等待游戏停止, 然后再总结这一回合中的所有转折点, 再更新行动准则。

Temporal-difference update:在游戏进行中每一步都在更新, 不消等待游戏的停止, 如许就能边玩边进修了。

On-policy:必须本人在场, 并且必定是本人边玩边进修。

Off-policy:可以选择本身玩, 也可以选择看着别人玩, 经由过程看别人玩来进修别人的行动准则。

重要算法有下面几种,今天先只是简述:

1. Sarsa

开辟者自述:我是如许懂得强化进修的

Q 为动作效用函数(action-utility function),用于评价在特定状况下采取某个动作的好坏,可以将之懂得为智能体(Agent)的大年夜脑。

SARSA 应用马尔科夫性质,只应用了下一步信息, 让体系按照策略指引进行摸索,在摸索每一步都进行状况价值的更新,更新公式如下所示:

在序列第一次碰着或者每次碰着一个状况 s 时,寂?驿衰减嘉奖:

开辟者自述:我是如许懂得强化进修的

s 为当缁ご态,a 是当前采取的动作,s’ 为下一步状况,a’ 是下一?状况采取的动作,r 是体系获得的嘉奖, α 是进修率, γ 是衰减因子。

2. Q learning

开辟者自述:我是如许懂得强化进修的

开辟者自述:我是如许懂得强化进修的

Q Learning 的算法框架和 SARSA 类似, 也是让体系按照策略指引进行摸索,在摸索每一步都进行状况价值的更新。关键在于 Q Learning 和 SARSA 的更新公式不一样,Q Learning 的更新公式如下:

开辟者自述:我是如许懂得强化进修的

3. Policy Gradients

体系会年腋荷琐固定或者随机肇端状况出发,策略梯度让体系摸索情况,生成一个大年夜肇端状况到终止状况的状况-动作-嘉奖序列,s1,a1,r1,.....,sT,aT,rT,在第 t 时刻,我们让 gt=rt+γrt+1+... 等于 q(st,a) ,大年夜而求解策略梯度优化问题。

4. Actor-Critic

开辟者自述:我是如许懂得强化进修的

算法分为两个部分:Actor 和 Critic。Actor 更新策略, Critic 更新价值。Critic 就可以用之前介绍的 SARSA 或者 Q Learning 算法。

5. Monte-carlo learning

用当前策略摸索产生一个完全的状况-动作-嘉奖序列:

s1,a1,r1,....,sk,ak,rk~π

开辟者自述:我是如许懂得强化进修的

最后更新状况价值:

开辟者自述:我是如许懂得强化进修的

6. Deep-Q-Network

开辟者自述:我是如许懂得强化进修的

应用举例

DQN 算法的重要做法是 Experience Replay,将体系摸索情况获得的数据储存起来,然后随机采样样本更新深度神经收集的参数。它也是在每个 action 和 environment state 下达到最大年夜回报,不合的是加了一些改进,参加了经验回放和决战收集架构。

https://www.zhihu.com/question/41775291

开辟者自述:我是如许懂得强化进修的

强化进修有很多应用,除了无人驾驶,AlphaGo,玩游戏之外,还有下面这些工程中实用的例子:

1. Manufacturing

例如一家日本公司 Fanuc,工厂机械人在拿起一个物体时,会捕获这个过程的视频,记住它每次操作的行动,操作成功照样掉败了,积聚经验,下一次可以更快更准地采取行动。

开辟者自述:我是如许懂得强化进修的

2. Inventory Management

在库存治理中,因为库存量大年夜,库存需求波动较大年夜,库存补货速度迟缓等阻碍使得治理是个比较难的问题,可以经由过程建立强化进修算法来削减库存周转时光,进步空间应用率。

3. Dynamic pricing

制造商在向各个客户运输时,想要在知足客户的所有需求的同时降低车队总成本。经由过程 multi-agents 体系和 Q-learning,可以降低时光,削减车辆数量。

5. ECommerce Personalization

在电商中,也可以用强化进修算法来进修和分析顾客行动,定制产品和办事以知足客户的个性化需求。

6. Ad Serving

例如算法 LinUCB (属于强化进修算法 bandit 的一种算法),会测验测验投放更广范围的告白,尽管以前还没有被浏览很多,可以或许更好地估计真实的点击率。


  推荐阅读

  梅奥医院成立AI初创公司,要用神经网络开发新药

【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路! 捷报道, Qrativ公司将结合 nference 基于 AI 的常识综合平台与梅奥诊所世界有名的医疗专业常识和临床数据>>>详细阅读


本文标题:开发者自述:我是这样理解强化学习的

地址:http://www.17bianji.com/lsqh/36264.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)