马诗语,黄润才
上海工程技术大学电子电气工程学院,上海 201620
糖尿病是当前威胁全球人类健康的最重要的非传染性疾病之一,根据国际糖尿病联盟统计,2011年全球糖尿病患者已达3.7 亿,其中80%在发展中国家,预计到2030年全球将有5亿多糖尿病患者[1]。中国糖尿病患者在全球占比最高,成人糖尿病患者约1.298亿,平均每10个成年人中有1个糖尿病患者,因此,防治糖尿病成为重点难题之一。然而,我国糖尿病血糖控制状况不佳,有研究显示,糖尿病知晓率、治疗率、控制率均偏低[1]。为此,需要加强居民对糖尿病知识的关注,通过分析糖尿病相关知识来引导广大市民及医疗卫生机构提早预防或延缓这一疾病的发生[2]。人们对如何迅速从众多文献中获取专业知识给予了极大的关注。医学文本挖掘技术在文本知识的自动获取中起着重要作用,作为这项技术的任务之一,糖尿病命名实体识别(Named Entity Recognition, NER)旨在从糖尿病文献中识别特定类型的名称,如1型糖尿病、2型糖尿病、血糖、胰岛素促分泌素等[3]。NER 为下一步关系抽取,构建知识图谱提供了前提;为引导广大市民了解糖尿病相关知识,指导糖尿病患者加强健康管理提供了技术帮助。
百度研究院在2015年提出了深度学习应用NER的经典模型,即BILSTM-CRF[4],凭借双向长短期记忆网络(Bidirectional Long Short-Term Memory Network,BILSTM)对上下文信息进行深度建模,条件随机场(Conditional Random Fields,CRF)利用特征矩阵解码整个句子的标签。Strubell等[5]提出迭代膨胀卷积神经网络(Iterated Dilated Convolutional Neural Network,IDCNN),与传统的CNN相比,此模型在大文本和结构化预测中具有更好的表现能力。……