作家
登录

从概念到应用,全面了解强化学习

作者: 来源: 2017-07-26 09:03:41 阅读 我要评论

固然是周末,也保持充电,今天来看看强化进修,不过不是要用它来玩游戏,而是认为它在制造业,库存,电商,告白,推荐,金融,医疗等与我们生活互相干注的范畴也有很好的应用,当然要懂得一下了。

本文构造:

  1. 定义

  2. 和监督式进修, 非监督式进修的差别

  3. 强化进修是机械进修的一个重要分支,是多学科多范畴交叉的一个产品,它的本质是解决 decision making 问题,即主动进行决定计划,并且可以做持续决定计划。

    让我们以小孩进修走路来做个形象的例子:

    小孩想要走路,但在这之前,他须要先站起来,站起来之后还要保持均衡,接下来还要先迈出一条腿,是左腿照样右腿,迈出一步后还要迈出下一步。

    小孩就是 agent,他试图经由过程采取行动(即行走)来把持情况(行走的外面),并且年腋荷琐状况改变到另一个状况(即他走的每一步),当他完成义务的子义务(即走了几步)时,孩子获得嘉奖(给巧克力吃),并且当他不克不及走路时,就不会给巧克力。

    agent

    2. 和监督式进修, 非监督式进修的差别

    在机械进修中,我们比较熟知的是监督式进修,非监督进修,此外还有一个大年夜类就是强化进修:

    强化进修

    强化进修和监督式进修的差别:

    监督式进修就比如你在进修的时刻,有一个导师在旁边指导,他知道怎么是对的怎么是错的,但在很多实际问题中,例如 chess,Go,这种有成千上万种组合方法的情况,弗成能有一个导师知道所有可能的结不雅。

    而这时,强化进修会在没有任何标签的情况下,经由过程先测验测验做出一些行动获得一个结不雅,经由过程这个结不雅是对照样错的反馈,调剂之前的行动,就如许赓续的调剂,算法可以或许进修到在什么样的情况下选择什么样的行动可以获得最好的结不雅。

    就比如你有一只还没有练习好的小狗,每当它把房子弄乱后,就削减厚味食物的数量(处罚),每次表示不错时,就加倍厚味食物的数量(嘉奖),那么小狗最终会学到一个常识,就是把客堂弄乱是不好的行动。

    两种进修方法都邑进修出输入到输出的一个映射,监督式进修出的是之间的关系,可以告诉算法什么样的输入对应着什么样的输出,强化进修出的是给机械的反馈 reward function,即竽暌姑来断定这个行动是好是坏。

    别的强化进修的结不雅反馈有延时,有时刻可能须要走了很多步今后才知道以前的某一步的选择是好照样坏,而监督进修做了比较坏的选择会急速反馈给算法。

    并且强化进修面对的输入老是在变更,每当算法做出一个行动,它影响下一次决定计划的输入,而监督进修的输入是自力同分布的。

    重要算法和类别


  4. exploration 会测验测验很多不合的工作,看它们是否比页堪测验测验过的更好。
    exploitation 会测验测验以前经验中最有效的行动。

    一般的监督进修算法不推敲这种均衡,就只是是 exploitative。

    强化进修和非监督式进修的差别:

    非监督式不是进修输入到输出的映射,而是模式。例如在向用户推荐消息文┞仿的义务中,非监督式会找到用户先前已经浏览过类似的文┞仿并向他们推荐其一,而强化进修精晓过向用户先推荐少量的消息,并赓续获得来自用户的反馈,最后构建用户可能会爱好的文┞仿的 “常识图”。

    3. 重要算法和分类

    大年夜强化进修的几个元素的角度划分的话,办法重要有下面几类:

    • Value based, 存眷点是找到最优嘉奖总和。

    • 我们可以用一个最熟知的观光商例子来看,

      我们要大年夜 A 走到 F,每两点之间表示这条路的成本,我们要选择路径让成本越低越好:

      大年夜概念到应用,周全懂得强化进修

      那么几大年夜元素分别是:

      • Action based, 存眷点是每一步的最优行动。

      states ,就是节点 {A, B, C, D, E, F}

    • action ,就是大年夜一点走到下一点 {A -> B, C -> D, etc}

    • reward function ,就是边上的 cost

    • policy,就是完成义务的┞符条路径 {A -> C -> F}

    有一种走法是如许的,在 A 时,可以选的 (B, C, D, E),发明 D 最优,就走到 D,此时,可以选的   (B, C, F),发明 F 最优,就走到 F,此时完成义务。
    这个算法就是强化进修的一种,叫做 epsilon greedy,是一种 Policy based 的办法,当然了这个路径并不是最优的走法。

    此外还可以大年夜不合角度使分类更细一些:

    如下图所示的四种分类方法,分别对应着响应的重要算法:

    大年夜概念到应用,周全懂得强化进修

    • Model-free:不测验测验去懂得情况, 情况给什么就是什么,一步一步等待真实世界的反馈, 再根据反馈采取下一步行动。

    • Model-based:先懂得真实世界是如何的, 并建立一个模型来模仿实际世界的反馈,经由过程想象来预断定接下来将要产生的所有情况,然后选择这些想象情况中最好的那种,并根据这种情况来采取下一步的策略。它比 Model-free 多出了一个虚拟情况,还有想象力。


        推荐阅读

        经开周世义:智慧园区应与城市化建设深度融合

      7月22日,"2017家当园区融合成长与园区聪明化岑岭论坛"在京举办,来自家当园区开辟扶植、运营治理、投融资、聪明园区等范畴的与会代表近200人参加了本次论坛晃荡。【编辑推荐】物联网开放>>>详细阅读


      本文标题:从概念到应用,全面了解强化学习

      地址:http://www.17bianji.com/lsqh/36404.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)