基于多示例学习的长文档检索

2021-09-07 07:45:46郝文宁靳大尉
无线电工程 2021年9期
关键词:语义文本模型

田 媛,郝文宁,靳大尉,陈 刚,邹 傲

(陆军工程大学 指挥控制工程学院,江苏 南京 210000)

0 引言

近年来,随着网络的快速发展,积累了海量的信息资源,为了有效利用这些信息资源,帮助人们从中快速获取所需信息,信息检索(Information Retrieval,IR)技术得到了越来越多的关注和发展。信息检索的目标是根据用户的查询返回相关度高的文档,计算词、句子、段落以及文档之间的相似性是信息检索任务中的一个重要组成部分[1],针对长文本的检索,常见的冗余文档处理、不端文献检测等,现有的基于词频的方法(TF-IDF、词袋模型),往往忽略了文本的语义信息。此外,当文本较长时,一些与查询相关的词分散在文档中,直接比较整篇文档会影响检索性能,并且一些文本相关性计算方法或相似度匹配算法往往会受到长度的影响[2-3]。

很多研究者致力于将文本表示与相似度计算相结合以提升文档检索性能[4-5],已有的一些方法通过简单地将文本中每个句子的句向量进行拼接或者叠加来获取整个文档的向量表示,然后计算文档与查询的相似度,但是这样会造成语义缺失;还有一些基于句相似度的检索模型,通过检索出相关度高的句子来反向定位其所在的文档,但这样可能会使得同一篇文档被重复检索,因为相似度得分高的多个句子可能出自同一篇文档。

多示例学习(Multiple Instance Learning,MIL)最早由Dietterichet等人[6]提出用于药物分子活性检测,随后被广泛应用在场景分类等问题中,相对于单示例,多示例能更好地描述样本。……

登录APP查看全文

猜你喜欢
语义文本模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
语言与语义
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
电子制作(2018年18期)2018-11-14 01:48:06
3D打印中的模型分割与打包
“上”与“下”语义的不对称性及其认知阐释
现代语文(2016年21期)2016-05-25 13:13:44
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
认知范畴模糊与语义模糊
如何快速走进文本
语文知识(2014年1期)2014-02-28 21:59:13