【限时免费】岁尾最强一次云计算大年夜会,看传统、社区、互联网企业若何碰撞?
定名实体辨认(Named Entity Recognition,NER)就是大年夜一段天然说话文本中找出相干实体,并标注出其地位以及类型,如下图。定名实体辨认是NLP范畴中的一些复杂义务的基本问题,诸如主动问答,关系采取,信息检索等 ,其效不雅直接影响后续处理的效不雅,是以是NLP研究的一个基本问题。
1、定名实体辨认

NER一向是NLP范畴中的研究热点,如今越来越多的被应用于专业的范畴,如医疗、生物等。这类行业往往具有大年夜量的专业名词,名词与名词之间互相之存放在着不合种类的关系。NER的研究大年夜一开端的基于词典和规矩的办法,基于统计机械进修的办法,到近年来基于深度进修的办法,NER研究的进展趋势如下图所示。

基于统计机械进修的办法重要包含:隐马尔可夫模型(HiddenMarkovModel HMM)、最大年夜熵(MaxmiumEntropy,ME)、支撑向量机(Support VectorMachine,SVM)、前提随机场( Conditional Random Fields,CRF)等。
隐马尔可夫模型(HMM)重要应用Viterbi算法求解定名实体类别序列,在练习和辨认时的效力较高且速度较快。隐马尔可夫模型实用于一些对及时性有请求以及像信息检索如许须要处理大年夜量文本的应用,如短文本定名实体辨认。
最大年夜熵模型(ME)构造紧凑,具有较好的通用性,缺点是练习时光复杂性高,有时甚至练习价值难以遭受,因为须要明白的归一化计算,导致计算开销比较大年夜。
传统的公认比较好的处理算法是前提随机场(Conditional Random Field,CRF),它给定一组输入随机变量前提下另一组输出随机变量的前提概率分布模型,其特点是假设输出随机变量构成马尔可夫随机场,它是一种判别式概率模型,是随机场的一种。CRF常用于标注或分析序列材料,如天然说话文字或是生物序列,在NER中的根本应用是给定一系列的特点去猜测每个词典标签。

上图中,X我们可以看做成一句话的每个单词对应的特点,Y可以看做成单词对应的标签。这里的标签就是对应场景下的人名、地名等等。
CRF长处:容身于局部最优解,在已给出z的前提下计算可能的序列 y 的概率分布。
近年来跟着深度进修的飞速成长,像RNN、LSTM这些模型在NLP义务中获得了广泛的应用,其特点在于具备强大年夜的序列建模才能,它们可以或许很好地捕获高低文信息,同时具备神经收集拟合非线性的才能,这些都是比CRF具有优势的处所。LSTM的长处在于获取长时光序列上样本与样本之间的关系,而BiLSTM可以更有效的获取输入语句前后的特点。BiLSTM+CRF已在NLP多半场景中表示出异常优胜的效不雅。例如在分词义务中,比较传统的分词器,BiLSTM能发挥双向获取句子特点这一优势,分词效不雅更接军人类认知的感到。

2、关系采取
在当前NLP研究中,关系采取(relation extraction)义务被广泛应用于数据简化和构建常识图谱中。给定用户输入的一段天然说话,在精确辨认实体的基本上,采取它们之间的关系就是亟待解决的重要问题。今朝解决这个问题的办法分为串联采取和结合采取两类。一般传统的串联采取办法是在实体采取的基本长进行实体之间关系的辨认。在这种办法中,先期实体识其余结不雅会影响到关系采取的结不雅,前后轻易产生误差累积。针对这一问题,基于传统机械进修的结合模型(Joint model)被提出场慢慢用于对这一类的NLP义务进行结合进修。

结合模型的办法重要基于神经收集的端对端模型同时实实际体采取和关系采取,如许做可以或许更好的将实体和个中的关系信息进行结合。
在论文《Joint Entity and Relation Extraction Based>

经由过程底层的模型参数共享,在练习时两个义务都邑经由过程后向传播算法来更新共享参数来实现两个子义务之间的依附。
在论文《A neural joint model for entity and relation extraction from biomedical text》中,作者将结合进修的办法用于生物医学实体辨认和关系采取傍边,在关系分类时,输入的语句起首进行依存分析构建起依存句法树,然后将这种树状构造输入到Bilstm+RNN的收集中进行关系分类,如下图:

经由过程以上的办法可以看出,两个义务的收集经由过程共享参数的方法结合进修,练习先辈行NER,再根据NER的结不雅进行关系分类。
本年ACL的Outstanding Paper《Joint Extraction of Entities and Relations Based>
上图中“CP”代表“Country-President”,“CF“代表“Company-Founder”,如许就将本来的两个子义务完全转换为一个序列标注问题,作者应用“BIES”(Begin,Inside,End,Single)进行标注,来表示当前词在全部 entity 中的地位,关系类型则来自于预先设定的关系类型集合。用“1”,“2”来表示entity在关系中的角色信息,个中“1”表示,当前词属于三元组(Entity1,RelationType,Entity2)的 Entity1,同理”2”表示,当前词属于Entity2,根据标注结不雅将两个相邻次序实体组合为一个三元组。例如:经由过程标注标签可知,“United”与“States”组合形成了实体“United States”,实体“United States”与实体“Trump”组合成了三元组 {United States, Country-President,Trump}。
推荐阅读
一、引言软件定义广域网(software-defined wide area network,SD-WAN)是软件定义收集(software defined networking,SDN)>>>详细阅读
本文标题:浅析深度学习在实体识别和关系抽取中应用
地址:http://www.17bianji.com/lsqh/40243.html
1/2 1

网友点评
精彩导读
科技快报
品牌展示