作家
登录

一文读懂监督学习、无监督学习、半监督学习、强化学习这四种深度学习方式

作者: 来源: 2017-06-12 16:08:06 阅读 我要评论

https://www.youtube.com/watch?v=RD0nNK51Fp8

半监督进修在练习阶段结合了大年夜量未标记的数据和少量标签数据。与应用所有标签数据的模型比拟,使悠揭捉?练集的练习模型在练习时可以更为精确,并且练习成本更低。

数学爱好者的福利:如不雅你对半监督进修很感兴趣的话,可以来浏览这个朱小津传授的 幻灯片教程 和2008年回想的 文献漫笔文┞仿 。 (我们会把这两个共享在平台的共享文件专栏)

强化进修(Reinforcement Learning)

为什么应用未标记数据有时可以赞助模型更精确,关于这一点的领会就是:即使你不知道谜底,但你也可以经由过程进修来知晓,有关可能的值是若干以及特定值出现的频率。

强化进修是针对你再次没有标注数据集的情况而言的,但你照样有办法来区分是否越来越接近目标(回报函数(reward function))。经典的儿童游戏——“hotter or colder”。 ( Huckle Buckle Beanstalk 的一个变体 )是这个概念的一个很好的例证。你的义务是找到一个隐蔽的目标物件,然后你的同伙会喊出你是否越来越hotter(更接近)或colder(远离)目标物件。“Hotter/colder”就是回报函数,而算法的目标就是最大年夜化回报函数。你可以把回报函数当做是一种延迟和稀少的标签数据情势:而不是在每个数据点中获得特定的“right/wrong”谜底,你会获得一个延迟的反竽暌功,而它只会提示你是否在朝着目标偏向进步。

稍后我们将具体介绍一下这个确切的过程,编写一个辨认号片的iPhone应用法度榜样。

•DeepMind在Nature上揭橥了一篇文┞仿,描述了一个将强化进修与深度进修结合起来的体系,该体系学会该若何去玩一套Atari视频游戏,一些取得了巨大年夜成功(如Breakout),而另一些就没那么荣幸了(如Montezuma’s Revenge(蒙特祖玛的复仇))。

•Nervana团队(如今在英特尔) 揭橥了一个很好的 解惑性博客文┞仿 , 对这些技巧进行了具体介绍,大年夜家有兴趣可以浏览一番。

https://www.nervanasys.com/demystifying-deep-reinforcement-learning/

•Russell Kaplan,Christopher Sauer和Alexander Sosa举办的一个异常有创意的斯坦福学生项目说清楚明了强化进修的挑衅之一,并提出了一个聪慧的解决筹划。正如你在DeepMind论文中看到的那样,算法未能进修若何去玩Montezuma’s Revenge。其原因是什么呢?正如斯坦福大年夜学生所描述的那样,“在稀缺回报函数的情况中,强化进修agent仍然在尽力进修”。当你没有获得足够的“hotter”或者“colder”的提示时,你是很难找到隐蔽的“钥匙”的。斯坦福大年夜学的学生基本性地教导体系去懂得和回应天然说话提示,例如“climb down the ladder”或“get the key”,大年夜而使该体系成为OpenAI gym中的最高评分算法。 可以点击 算法视频 不雅看算法演示。

(http://mp.weixinbridge.com/mp/wapredirect?url=https%3A%2F%2Fdrive.google.com%2Ffile%2Fd%2F0B2ZTvWzKa5PHSkJvQVlsb0FLYzQ%2Fview&action=appmsg_redirect&uin=Nzk3MTk3MzIw&biz=MzA5MzQwMDk4Mg==&mid=2651042109&idx=1&type=1&scene=0)

•不雅看这个关于强化进修的算法,好好进修,然后像一个大年夜boss一样去玩超等马里奥吧。

理查德•萨顿和安德鲁•巴托写了关于强化进修的书。你也可以点击查看第二版草稿。 http://incompleteideas.net/sutton/book/the-book-1st.html

【编辑推荐】

  1. Keras TensorFlow教程:若何大年夜零开辟一个复杂深度进修模型
  2. 态牛-Tech Neo 5月刊:深度进修
  3. 拭魅战微课—决胜AI 5分钟懂得什么是深度进修
  4. 谁说数据少就不克不及用深度进修?这锅俺不背!
  5. 深度进修成了前端开辟神器:根据UI设计图主动生成代码
【义务编辑:林师授 TEL:(010)68476606】

  推荐阅读

  从青云QingCloud完成D轮融资,观其如何在云计算下半场“平步青云”

【51CTO.com原创稿件】6月12日,青云QingCloud消息刷爆同伙圈。据记者懂得,此次融资金额为10.8亿元人平易近币,是今朝为止中国云枷⒚鹦业财务性融资单笔最高金额。本轮的投资方包含招商证>>>详细阅读


本文标题:一文读懂监督学习、无监督学习、半监督学习、强化学习这四种深度学习方式

地址:http://www.17bianji.com/lsqh/35710.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)