马应龙 李鹏鹏 张敬旭
(1 华北电力大学控制与计算机工程学院,北京102206)
(2 甘肃省电力公司,兰州730030)
Web 信息量的爆炸式增长对信息获取手段提出了更高的要求.传统的基于语法的检索方式存在精度偏低和冗余文档过多等问题,基于概念的语义检索成为研究热点.近年来,其研究内容主要包括3 个方面:①基于用户信息的个性化,即利用分析用户历史[1-2]或个人信息[3]来提高检索精度;②利用数学模型计算上下文的语义关联度,以增加检索结果的有效涵盖面[4-5];③侧重检索结果的优化,对检索结果进行重新排序和组织,以改善用户体验[6-7].但这些方法仍然存在用户数据和分类信息获取困难的问题,且没有考虑不同个人信息的重要程度.
本文提出了一种基于多分类语义分析和个性化的语义检索方法.它使用多分类语义分析对目标文本进行语义分类,利用分类结果和分类过程中获取的词向量库,结合用户个人信息和检索历史数据对目标文档进行分析匹配.相关实验评估和分析显示,本文方法能在额外时间开销较小的情况下大幅提高综合语义检索效果.
语义分析(semantic analysis)是一种向量表示方法,通过计算每个词和预定义好的概念之间的关系,对词和文档片段进行阐释.Li 等[8]提出了简明语义分析,利用语料库的类别标签构造概念空间,能有效降低文档向量维数、提高分类效率,且这种思想在语议检索领域具有较高的价值[9].但在确……