王楠鑫 蒋玉婷
摘要:本文主要介绍了一种常用的机器学习方法——度量学习。度量学习旨在学得一个合适的距离来优化分类器的性能,提高分类器的效率。本文對度量学习的基本概念做简介,并分析5E38见的度量学习形式和方法,最后讨论了一些度量学习研究中的前沿问题。
关键词:度量学习
一、度量学习简介
在机器学习任务中,样本之间的距离是一个十分重要的因素,绝大多数机器学习模型和算法都直接或间接地使用了样本之间的距离。比如,在常见的“K近邻”分类器中,样本间的距离很大程度上影响了最终分类效果的好坏[1]。实际上,几乎所有分类算法都可以在某个特定的距离下等价于“近邻分类器”。在机器学习任务中,我们也常常通过特征选择、特征提取等手段来对寻找数据更好的表示,或是达到降维的目的,而寻求数据更好的表示或降维最终是为了在得到的子空间中学习,这本质上就是基于子空间中的距离进行学习。既然如此,我们完全可以直接寻找一个合适的距离,并利用这个学到的距离来完成各种任务。可以说,各种特征选择、特征提取和表示学习方法都相当于是在做度量学习。总而言之,度量学习的目的就是寻找一个合适的距离定义,使得在这种距离定义下,相似样本离得较近,而不相似样本离得较远,进而来优化某个机器学习任务。
距离往往用来衡量对象之间的相关性。常见的距离有欧几里得距离、马氏距离[2]、余弦距离、曼哈顿距离等。……