李村合,张振凯
(中国石油大学(华东)计算机与通信工程学院,青岛 266580)
在利用机器学习中的传统监督学习[1]解决实际问题时,常见的做法是先对真实的对象进行特征提取,用一个特征向量来描述这个对象,这样就得到了一个示例(instance),然后把示例与该对象所对应的类别标记(label)关联起来,就得到了一个例子(example).在拥有了一个较大的例子集合之后,就可以利用某种学习算法来学得示例空间与标记空间之间的一个映射,该映射可以预测未见示例的标记.在待学习对象具有明确的、单一的语义时,上面的学习框架已经取得了巨大的成功.但是真实世界中的对象往往具有复杂的含义,只用一个示例和一个标记来表达过于简单,在刚开始的表示阶段就失去了很多重要的信息.
为了解决上述问题,多示例多标签[2,3]框架应运而生.在该框架下一个对象用一组示例来表示,并且和一组类别标记相关联.比如一篇文章中的每个部分可以用一个示例来表示,而这篇文章可能同时属于“娱乐”、“旅游”、“经济”等不同的类别.多示例多标签已成功应用到了场景分类、基因功能注释、图像标注等领域,彰显了其强大的学习能力和潜力.
支持向量机(Support Vector Machines,SVM)[4]是一种高效的分类识别方法,在解决高维模式识别问题呈现出其独特的优势.它通过寻找一个最优分类超平面来实现分类.支持向量机以统计学习理论中的VC 维(Vapnik-Chervonenkis Dimension)理论[5]以及结构风险最小原理为基础,最终的决策函……