田 媛,郝文宁,靳大尉,陈 刚,邹 傲
(陆军工程大学 指挥控制工程学院,江苏 南京 210000)
近年来,随着网络的快速发展,积累了海量的信息资源,为了有效利用这些信息资源,帮助人们从中快速获取所需信息,信息检索(Information Retrieval,IR)技术得到了越来越多的关注和发展。信息检索的目标是根据用户的查询返回相关度高的文档,计算词、句子、段落以及文档之间的相似性是信息检索任务中的一个重要组成部分[1],针对长文本的检索,常见的冗余文档处理、不端文献检测等,现有的基于词频的方法(TF-IDF、词袋模型),往往忽略了文本的语义信息。此外,当文本较长时,一些与查询相关的词分散在文档中,直接比较整篇文档会影响检索性能,并且一些文本相关性计算方法或相似度匹配算法往往会受到长度的影响[2-3]。
很多研究者致力于将文本表示与相似度计算相结合以提升文档检索性能[4-5],已有的一些方法通过简单地将文本中每个句子的句向量进行拼接或者叠加来获取整个文档的向量表示,然后计算文档与查询的相似度,但是这样会造成语义缺失;还有一些基于句相似度的检索模型,通过检索出相关度高的句子来反向定位其所在的文档,但这样可能会使得同一篇文档被重复检索,因为相似度得分高的多个句子可能出自同一篇文档。
多示例学习(Multiple Instance Learning,MIL)最早由Dietterichet等人[6]提出用于药物分子活性检测,随后被广泛应用在场景分类等问题中,相对于单示例,多示例能更好地描述样本。……