屈倩倩,阚红星
(安徽中医药大学医药信息工程学院,安徽合肥 230011)
1991 年Rau 等人在第七届IEEE 人工智能会议上首次提出通过规则以及相关算法对文字中公司的名称进行识别的方法,命名实体识别的概念也由此诞生。命名实体识别的任务是从非结构化数据中抽取出一系列相关的专有名词,例如人名、地名等。作为自然语言处理中关键性的基础工作,命名实体识别模型的有效性直接关系到自然语言处理任务的成败。最初,命名实体识别通过手工构建规则模板的方式进行,该方式对语料库以及构建规则的专家依赖性较大,并且灵活性相对较差。随着计算机技术的不断发展,将机器学习的方法例如条件随机场(CRF)、支持向量机(SVM)等应用于命名实体识别也取得了巨大成效。文献[1]证明了多种特征与CRF结合的方式能够提高命名实体识别模型的准确性。文献[2]利用SVM 算法确定实体的后缀,并通过隐马尔可夫(HMM)模型对实体的前缀进行识别。近年来,神经网络算法以其在小样本的情况下仍能发挥出较强性能的优势,被广泛使用于各个领域的命名实体模型当中。文献[3]利用Transformer-BiGRUCRF 模型将电力领域命名实体识别的准确率提高了5%。文献[4]将卷积神经网络(CNN)与注意力机制相结合,测试集的结果显示该模型的F1 值虽然并没有大幅度增加,但是运行速度提高了一倍。医学命名实体识别的结果直接影响医疗辅助系统、医学数据挖掘、智能诊断系统的准确性[5],对于医学的发展有着重要意义。……