胜紫菡
摘要:近年来,信息检索中的排序学习受到越来越广泛的关注.本文将在机器学习的框架下介绍排序学习,基于机器学习方法的排序算法称为“学习排序法”.学习排序法的两个主要特点是:一是基于特征的特点:训练文本是用特征向量来表示的;二是判别训练:“学习排序法”有自己的输入空间,输出空间,假设空间和损失函数.本文将针对不同的学习算法详细阐述这四个主要成分。
关键词:机器学习;排序问题;信息检索
排序学习是典型的有监督学习,训练集是由查询,与查询相关的文档和相应的相关性判断标准组成.排序模型可以通过一个排序算法来预测训练集的真实标签.当给定一个新的查询时,就可以根据排序模型对文档进行排序.不同的排序算法定义不同的输入空间和输出空间,并且使用不同的假设空间和不同的损失函数.因此在机器学习框架下,我们将“排序学习”分为以下两类:
基于单个文档的排序方法(Pointwise approach)
基于配对文档的排序方法(Pairwise approach)
1.基于单个文档的排序方法
基于单个文档的排序方法是排序学习最早提出的算法,其基本思想是将训练集中的每个查询/文档对作为训练数据,再应用合适的算法来学习一个排序模型.因为每个查询/文档对都被看做一个单独训练样本,所以称这种方法为Pointwise方法.Pointwise方法的四个主要组成成分:
(1)输入空间:包含单个查询/文档对的特征向量
(2)输出空间:包含单个查询/文档对的相关度得分……p>