作家
登录

自然语言处理领域的核心:序列学习

作者: 来源: 2017-05-08 09:20:33 阅读 我要评论

如不雅我们我们用向量来代表空间里的每一个词,那么每个向量就由3个坐标构成,比如"cat"是(0, 0, 0),"kitty"可能是(0,1, 0,2, -0,3)而"car"则是(10, 0, -15)。这个向量空间,就是词嵌入空间,每个词对应的三个坐标可以用做算法的输入数据。

典范的词嵌入空间含有上千个词和上百个维度,仁攀类是很难直不雅懂得的,然则类似的词距离近这个规律仍然成立。对于机械来说,这是一种很好的词汇表征,可以进步天然说话处理才能。

如不雅你想要进修更多词嵌入的内容,以及若何应用于创建模型“懂得”说话,推荐浏览:Understanding Natural Language with Deep Neural Networks Using Torch,作者:Soumith Chintala和Wojciech Zaremba。


编码-解码

让我们临时停下天然说话处理,来想象一个西红柿,想象那些合适西红柿的配料或菜肴。如不雅你的设法主意和那些网上最常见的菜谱差不多,那你想到的可能是诸如奶酪和萨拉米;帕尔马干酪、罗勒、通心粉;或其他配料比瘸老榄油、百里喷鼻和西芹等等。(换作中国仁攀来想,肯定是鸡蛋)。这些配料重要都是意大年夜利、地中海菜系。

照样那个西红柿,如不雅要吃墨西哥菜系,你想到的可能是豆子、玉米、辣椒、芫荽叶或鳄梨。

你刚才所想的,就是把词汇“西红柿”的表征变换成了新的表征:“墨西哥彩攀狼9依υ?红柿”。

“编码”(Encoder)做的是同样的事,它经由过程变换词汇的表征,把输入词汇逐个变换为新的“思维向量”。就像给“西红柿”参加了高低文“墨西哥菜”,这是“编码-解码”架构的第一步。

编码-解码架构的第二步是基于如许一个事实:不合的语种在词嵌入空间里,具有类似的几何构造,即便对同一个事物,描述用词完全不合。比如在德语里“猫”是"Katze",狗是"Hund",与英语截然不合,然则两个词之间的关系确切一样。Karze与Hund的关系,跟Car与Dog的关系完全一致,换言之,即使词汇本身不合,他们背后的“思维向量”确切一样的。当然也有些词汇很难用其他说话表达(比如中文里的“缘分”之类),然则这种情况比较奇怪,总体上是成立的。

基于以上思惟,我们就可以构建解码收集了。我们把英语编码器产生的“思维向量”传递给德语解码器。德语解码器会把这些思维向量或关系变换映射到德语词嵌入空间里,然后就会产生一句话,保持英语句子里的关系。如斯我们就有了一个能做翻译的收集,这个思惟今朝仍在成长,结不雅固然不完美,但却在极快进步,不久就会成为翻译的最佳办法。

【义务编辑:林师授 TEL:(010)68476606】

  推荐阅读

  如何快速破解识别APT28网络攻击流量

近期,欧洲多国大年夜选开端,客岁涉嫌收集进击干涉美国总统选举的APT28又开端活泼了。接踵有德国、丹麦等国纷纷责备APT28的大年夜肆入侵进击行动。而就在比来的法国大年夜选中,有安然专家分析称,APT28可能已经针对>>>详细阅读


本文标题:自然语言处理领域的核心:序列学习

地址:http://www.17bianji.com/lsqh/35041.html

关键词: 探索发现

乐购科技部分新闻及文章转载自互联网,供读者交流和学习,若有涉及作者版权等问题请及时与我们联系,以便更正、删除或按规定办理。感谢所有提供资讯的网站,欢迎各类媒体与乐购科技进行文章共享合作。

网友点评
自媒体专栏

评论

热度

精彩导读
栏目ID=71的表不存在(操作类型=0)