谢博,申国伟,郭春,周燕,于淼
(1.贵州大学计算机科学与技术学院,贵州 贵阳 550025;2.贵州省公共大数据重点实验室,贵州 贵阳 550025;3.中国科学院信息工程研究所,北京 100093)
在网络空间安全态势日趋复杂的形势下,威胁情报驱动的网络安全防御成为业界关注的重点[1]。从海量碎片化的网络数据中挖掘威胁情报,采用知识图谱模型进行组织,支撑攻击路径预测、攻击溯源等,可实现海量数据驱动的威胁情报智能分析。
网络安全实体识别是威胁情报知识图谱构建任务中非常重要的一个基础任务[2],其目标是从网络安全领域的文本数据中提取出安全实体的语义类,如攻击组织、企业、漏洞、软件等。
网络安全实体识别属于一种特定领域的命名实体识别。命名实体识别是自然语言处理中的一项重要研究内容,主要有基于规则的命名实体识别方法、基于机器学习的命名实体识别方法和基于深度学习的命名实体识别方法[3]。由于深度学习方法能够自适应地提取文本的特征信息,不依赖大量的特征工程和额外的语言学知识,因此,深度学习被广泛地应用在命名实体识别任务中[4]。
Georgescu等[5]通过基于命名实体识别的解决方案来增强和检测物联网系统中可能存在的漏洞。王通等[2]使用深度置信网络对威胁情报知识图谱实体识别子任务中的安全实体进行有效识别。2003年,Hammerton[6]利用长短记忆模型(LSTM)抽取句子的序列信息,并通过条件随机场(CRF,conditional random fields)对命名实体的标签进行分类。……