曾 辉,胡 蓉,淦修修,彭志颖,熊李艳
(华东交通大学信息工程学院,江西 南昌330013)
在信息时代,为了便于人们获取感兴趣的视觉数据,从一个大规模数据库中快速地找到和查询图像内容相关或相似的图像,并按相关的排序返回给用户是很常见的需求。 但是随着多媒体数据,特别是图像视频文字数据,呈爆炸式增长,单纯使用图像来检索图像的单模态检索方式已经难以满足当前用户的需求[1],以互联网上庞大数目的图像视频以及描述性文本等数据为基础的多模态数据研究已经成为当前检索系统领域的研究热点。
目前相关的研究大多利用数据间的共存与互补特征来分析多模态之间的语义理解与关联性表示。 其中典型相关分析(canonical correlation analysis,CCA)[2]是跨模态检索研究中最常用的方法,通过寻找一个线性映射向量能够将映射至相同子空间后的两类模态数据相关系数最大化来实现跨模态检索。Tenenbaum J B 等[3]为跨模态识别提出双线性因子模型(bilinear model,BLM),能够对因子交互进行充分表达,并基于奇异值分解算法来拟合数据。Akaho S[4]就运用了改进的非线性CCA 算法KCCA,即核典型相关分析算法,把核函数的思想引入CCA 中。 Gong Y[5]使用改进的KCCA 算法,但是增加了图像和文本之外的第三类特征—语义关键词。 语义相关匹配[6](semantic correlation matching,SCM)将文本语义抽象化并融合入典型相关分析学习过程中,提高了跨模态检索的准确性。 Jacobs D W 等[7]提出广义多视判别分析方法(generalized multiview analysis,GMA),将特征提取转化为求解广义特征值问题,解决在不同特征空间的联合表示,获得有效的潜在子空间表示,这是CCA 方法的有监督扩展。……