作家
登录

开发者自述:我是这样理解强化学习的

作者: 来源: 2017-07-18 11:58:28 阅读 我要评论

【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路!


定义

强化进修是机械进修的一个重要分支,是多学科多范畴交叉的一个产品,它的本质是解决 decision making 问题,即主动进行决定计划,并且可以做持续决定计划。

它重要包含四个元素,agent,情况状况,行动,嘉奖,强化进修的目标就是获得最多的累计嘉奖。

让我们以小孩进修走路来做个形象的例子:

小孩想要走路,但在这之前,他须要先站起来,站起来之后还要保持均衡,接下来还要先迈出一条腿,是左腿照样右腿,迈出一步后还要迈出下一步。

小孩就是 agent,他试图经由过程采取行动(即行走)来把持情况(行走的外面),并且年腋荷琐状况改变到另一个状况(即他走的每一步),当他完成义务的子义务(即走了几步)时,孩子获得嘉奖(给巧克力吃),并且当他不克不及走路时,就不会给巧克力。

开辟者自述:我是如许懂得强化进修的

和监督式进修, 非监督式进修的差别

别的强化进修的结不雅反馈有延时,有时刻可能须要走了很多步今后才知道以前的某一步的选择是好照样坏,而监督进修做了比较坏的选择会急速反馈给算法。

在机械进修中,我们比较熟知的是监督式进修,非监督进修,此外还有一个大年夜类就是强化进修:

开辟者自述:我是如许懂得强化进修的

强化进修和监督式进修的差别:

监督式进修就比如你在进修的时刻,有一个导师在旁边指导,他知道怎么是对的怎么是错的,但在很多实际问题中,例如 chess,Go,这种有成千上万种组合方法的情况,弗成能有一个导师知道所有可能的结不雅。

就比如你有一只还没有练习好的小狗,每当它把房子弄乱后,就削减厚味食物的数量(处罚),每次表示不错时,就加倍厚味食物的数量(嘉奖),那么小狗最终会学到一个常识,就是把客堂弄乱是不好的行动。

两种进修方法都邑进修出输入到输出的一个映射,监督式进修出的是之间的关系,可以告诉算法什么样的输入对应着什么样的输出,强化进修出的是给机械的反馈 reward function,即竽暌姑来断定这个行动是好是坏。

并且强化进修面对的输入老是在变更,每当算法做出一个行动,它影响下一次决定计划的输入,而监督进修的输入是自力同分布的。

经由过程强化进修,一个 agent 可以在摸索和开辟(exploration and exploitation)之间做衡量,并且选择一个最大年夜的回报。

exploration 会测验测验很多不合的工作,看它们是否比页堪测验测验过的更好。

exploitation 会测验测验以前经验中最有效的行动。

一般的监督进修算法不推敲这种均衡,就只是是 exploitative。

强化进修和非监督式进修的差别:

非监督式不是进修输入到输出的映射,而是模式。例如在向用户推荐消息文┞仿的义务中,非监督式会找到用户先前已经浏览过类似的文┞仿并向他们推荐其一,而强化进修精晓过向用户先推荐少量的消息,并赓续获得来自用户的反馈,最后构建用户可能会爱好的文┞仿的“常识图”。

大年夜强化进修的几个元素的角度划分的话,办法重要有下面几类:

  • Policy based, 存眷点是找到最优策略。

  • Value based, 存眷点是找到最优嘉奖总和。

  • Action based, 存眷点是每一步的最优行动。

我们可以用一个最熟知的观光商例子来看,

我们要大年夜 A 走到 F,每两点之间表示这条路的成本,我们要选择路径让成本越低越好:

开辟者自述:我是如许懂得强化进修的

那么几大年夜元素分别是:

  • states ,就是节点 {A, B, C, D, E, F}

  • action ,就是大年夜一点走到下一点 {A -> B, C -> D, etc}

  • reward function ,就是边上的 cost

  • policy,就是完成义务的┞符条路径 {A -> C -> F}

有一种走法是如许的,在 A 时,可以选的 (B, C, D, E),发明 D 最优,就走到 D,此时,可以选的 (B, C, F),发明 F 最优,就走到 F,此时完成义务。

这个算法就是强化进修的一种,叫做 epsilon greedy,是一种 Policy based 的办法,当然了这个路径并不是最优的走法。

此外还可以大年夜不合角度使分类更细一些:

开辟者自述:我是如许懂得强化进修的

Model-free:不测验测验去懂得情况, 情况给什么就是什么,一步一步等待真实世界的反馈, 再根据反馈采取下一步行动。

Model-based:先懂得真实世界是如何的, 并建立一个模型来模仿实际世界的反馈,经由过程想象来预断定接下来将要产生的所有情况,然后选择这些想象情况中最好的那种,并根据这种情况来采取下一步的策略。它比 Model-free 多出了一个虚拟情况,还有想象力。

Policy based:经由过程感官分析所处的情况, 直接输出下一步要采取的各类动作的概率, 然后根据概率采取行动。

Value based:输出的是所有动作的价值, 根据最高价值来选动作,这类办法不克不及选掏出续的动作。


  推荐阅读

  梅奥医院成立AI初创公司,要用神经网络开发新药

【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路! 捷报道, Qrativ公司将结合 nference 基于 AI 的常识综合平台与梅奥诊所世界有名的医疗专业常识和临床数据>>>详细阅读


本文标题:开发者自述:我是这样理解强化学习的

地址:http://www.17bianji.com/lsqh/36264.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)