4月7日消息,OpenAI在官网颁布了一项最新的研究结不雅,介绍了一个可以高效进修情感表征的无监督体系,今朝可以或许猜测亚马逊评论中的下一?字符。
研究人员采取了线性模型,在一个小型然则被广泛采取的数据集(Standford Sentiment Treebank)上取得了异常高的情感分析精确度:OpenAI获得的精确度为91.8%,而之前最好的是90.2%。这一表示可以匹敌之前的监督体系,并且罕用了30~100倍的标记样本。
此外OpenAI表示,其模型的表征还包含了一个自力的“情感神经元(sentiment neuron)”,这个“情感神经元”包含了几乎所有的情感旌旗灯号。
OpenAI称,“我们的体系在应用极少练习数据的情况下,比起其它同样用Stanford Sentiment Treebank测试的体系有着更好的结不雅。”
为了达到完全监督进修的效不雅,OpenAI的模型拔取了两个变量来代表标记的样本(绿色和蓝色的线条),每一个变量练习6920个样本(灰色虚线)。OpenAI的L1正则化模型(应悠揭捉?马逊的用户评论以无监督的方法进行预先练习)只用了11个标记的样本,其表示就可以或许与多通道的CNN(卷积神经收集)相匹敌,而应用了232个练习样本之后,其机能甚至达到了异常先辈的CT-LSTM Ensembles的程度。
练习办法
雷锋网懂得到,OpenAI起首应悠揭捉?马逊上的8200万条用户评论,练习了一个有4096个单位的乘性LSTM(multiplicative LSTM,简称mLSTM),来猜测一小段文本中的下一?字符。团队采取了4块英伟达的Pascal GPU,每小时可以或许处理12500个字符,练习总共花了一个月的时光。
这4096个单位(其实是浮点数构成的向量)可以算作是模型攫取的字符串的特点向量。在练习mLSTM之后,OpenAI将这些单位进行线性组合,经由过程现有的监督数据进修组合的权重,将本来的模型变成了情感分类器。
情感神经元
在用L1正则化练习线性模型的同时,令人惊奇的是,OpenAI留意到它应用的进修单位其实异常少。进一步发掘后,研究人员意识到模型中实际上存在着一种可以精准猜测情感值的“情感神经元”。
尽管这一模型仅被练习用来猜测文本中的下一?字符,然则模型中的情感神经元却可以将评论归为负面或者正面两类。
和其他类似的模型一样,OpenAI的模许可以用来生成文本;但不合的处地点于,OpenAI可以经由过程重写神经元的值来控制合成文字的情感。
上图是练习模型生成的合成文本的示例。研究人员先肯定情感神经元的值,然后大年夜模型中随机选择样本,以肯定评论中的情感。如下图所示,研究人员还经由过程模型传递前缀“I couldn’t figure out(我搞不清跋扈)”,然后只选择高度类似的样本。
【编辑推荐】
- 麦肯锡中国人工智能申报 直面庞座大年夜山
- 最合适人工智能开辟的5种编程说话
- 周鸿袆:通用型的人工智能都是骗子 必须结合垂直范畴
- 人工智能技巧是基于大年夜数据吃饭的?
- 将来三年,人工智能将成为银行与客户交换的重要方法
示例
下图表示情感神经元代表的每个字符的值,红色的为负,绿色为正。个中“best(最好)”或者“horrendous(恐怖的)”如许有强烈指导性的词语则会用更深的色彩重点标记。
值得留意的是,在完成句子和短语之后,体系会进行大年夜量更新。例如,在“And about 99.8 percent of that got lost in the film”中,即使“in the film”本身没有任何情感内容,然则在“lost”之后模型会进行一次负面更新,而在句子停止后还会有一次大年夜的更新。
有标记的数据是机械进修的燃料。收集数据很轻易,然则想要大年夜范围地标记数据则很艰苦。只有在机械翻译、语音辨认或者主动驾驶等具有切实效不雅和回报的范畴,大年夜范围地标记数据才是切实可行的。
无监督进修
长久以来,机械进修范畴的研究人员一向妄图着开辟出可以或许进修数据集的精确表征的无监督进修算法,欲望用很少的标记数据就可以或许解决问题。OpenAI的研究意味着,在创建具有优良表征进修才能的体系时,简单地应用大年夜量数据练习大年夜型无监督下一步猜测模型(next-step-prediction model)很可能是一种不错的办法。
下一步
OpenAI的研究结不雅代表通用无监督表征进修又向前迈进了一步。研究人员在摸索是否可以经由过程说话建模来进修高质量的表征时不测发清楚明了这一结不雅,并在经由细心选择的数据集上扩大年夜了这个现有模型。然而,今朝研究人员还不清跋扈这个潜在的现象的具体成因。
这些结不雅在长文档的数据上的表示并不是很好。OpenAI猜测,他们的模型难以记住数百甚至数千个时光步长的信息。他们认为,下一步可以测验测验采取层次模型(hierarchical model),因为层次模许可以自适应响应的时光标准。进一步扩大这些模型,还可能进一步进步表征保真度( representation fidelity ),以及在情感分析和类似义务方面的表示。
推荐阅读
简介如不雅 winecfg (WINE 的设备对象)是一把螺丝刀,那么 winetricks 就是一个钻床。它们各有特长,然则 winetricks 真的是一个强大年夜的多的对象。实际上,它甚至可以启动 winecfg。w>>>详细阅读
本文标题:OpenAI"巧妙"发现无监督情感神经元,可利用文本检测用户情感
地址:http://www.17bianji.com/lsqh/34694.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示