王庆棒,汪颢懿,左 敏,*,张青川,温 馨,袁玉梅
(1.北京工商大学 农产品质量安全追溯技术及应用国家工程实验室,北京 100048;2.北京工商大学 计算机与信息工程学院,北京 100048)
食品舆情领域知识图谱以食品行业为基础,挖掘食品舆情信息的相互联系,在食品安全、食品舆情分析等方面都有着重要作用。食品舆情的实体关系抽取是构建食品舆情知识图谱的重要基础工作之一,旨在抽取句子中已标记实体对之间的语义关系。
食品舆情信息的挖掘依赖于数据的多维度特征[1],多层次的网络模型实现了基于大规模语料的自动挖掘特征信息,目前的研究主要分为基于特征向量的方法[2]、基于核函数的方法[3]和基于神经网络模型的深度学习方法。黄卫春等[4]为了解决特征空间维度过高的问题,提出了4种文本文类的特征选择算法;姚全珠等[5]采用了子树特征的实体关系抽取方法;Zeng等[6]采取建模的方式,在卷积神经网络(convolutional neural network,CNN)中引入了位置向量,但对位置信息的挖掘程度有些不足;Nguyen等[7]在CNN上使用不同尺度的卷积核对文本的语义关系进行了表征,但该模型仍然是基于浅层语义关系。本研究拟在注意力机制上,采用基于词语位置的语义角色标注(semantic role labeling,SRL)方法,使模型更好地对词汇特征和位置信息进行学习,并提高模型的精确度。
Santors等[8]在CNN中对目标函数做出了改进,虽然该方法提高了实体关系的识别力度,但是CNN却仍然不能很好地学习语句中上下文的语义信息;Zhang和Wang[9]利用双向循环神经网络来学习语句中的上下文语义,然而循环神经网络本身具有梯度消失和梯度爆炸等问题。……