再如双 11 推荐场景中,阿里巴巴应用了深度强化进修与自适应在线进修,经由过程持续机械进修和模型优化建立决定计划引擎,对海量用户行动以及百亿级商品特点进行及时分析,赞助每一个用户敏捷发明瑰宝,进步人和商品的配对效力。还有,应用强化进修将手机用户点击率晋升了 10-20%。
7. Financial Investment Decisions
例如这家公司 Pit.ai,应用强化进修来评价交易策略,可以赞助用户建立交易策略,并赞助他们实现其投资目标。
8. Medical Industry
动态治疗筹划(DTR)是医学研究的一个主题,是为了给患者找到有效的治疗办法。 例如癌症这种须要经久施药的治疗,强化进修算法可以将患者的各类临床指标作为输入 来制订治疗策略。
进修材料
膳绫擎简单地介绍了强化进修的概念,差别,重要算法,下面是一些进修资本,供参考:
-
Udacity 课程:Machine Learning: Reinforcement Learning,Reinforcement Learning;
-
强化进修中的 Q-learning 可以用来处理动态订价问题。
4. Customer Delivery
http://t.cn/Raif2sl
-
而这时,强化进修会在没有任何标签的情况下,经由过程先测验测验做出一些行动获得一个结不雅,经由过程这个结不雅是对照样错的反馈,调剂之前的行动,就如许赓续的调剂,算法可以或许进修到在什么样的情况下选择什么样的行动可以获得最好的结不雅。
UC Berkeley开辟的经典的入门课程功课-编程玩“吃豆人”游戏:Berkeley Pac-Man Project (CS188 Intro to AI)
-
Stanford开辟的入门课程功课-简化版无人车驾驶:Car Tracking (CS221 AI: Principles and Techniques)
-
5.CS 294: Deep Reinforcement Learning, Fall 2015 CS 294 Deep Reinforcement Learning, Fall 2015。
-
David Silver强化进修:
http://t.cn/Rw0rwtU
参考文┞仿
http://www.jianshu.com/p/14625de78455
http://www.jianshu.com/p/2100cc577a46
重要算法和分类
https://www.marutitech.com/businesses-reinforcement-learning/
https://www.analyticsvidhya.com/blog/2017/01/introduction-to-reinforcement-learning-implementation/
https://morvanzhou.github.io/tutorials/machine-learning/ML-intro/4-02-RL-methods/
如下图所示的四种分类方法,分别对应着响应的重要算法:
http://www.algorithmdog.com/reinforcement-learning-model-free-learning
本文转自雷锋网,如需转载请至雷锋网官网申请授权。本文作者杨熹,原文来自小我博客。
【编辑推荐】
- 一文读懂监督进修、无监督进修、半监督进修、强化进修这四种深度进修方法
- 情感计算是人机交互核心?谈深度进修在情感分析中的应用
- 据说你懂得深度进修最常用的进修算法:Adam优化算法?
- 基于TensorFlow打造强化进修API:TensorForce是如何炼成的?
- 深度进修练习时 GPU 温度过高?输入这几行敕令就能敏捷降温
经挡裉科书:Sutton & Barto Textbook: Reinforcement Learning: An Introduction 被引用2万多次
推荐阅读
【技巧沙龙】AI开辟者拭魅战营-7分钟打造1个定制技能。7月22号,我们等你一路! 捷报道, Qrativ公司将结合 nference 基于 AI 的常识综合平台与梅奥诊所世界有名的医疗专业常识和临床数据>>>详细阅读
本文标题:开发者自述:我是这样理解强化学习的
地址:http://www.17bianji.com/lsqh/36264.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示