苏筱涵,丰洪才,吴诗尧
(1.武汉轻工大学 数学与计算机学院,湖北 武汉 430023;2.武汉轻工大学 网络与信息中心,湖北 武汉 430023)
视频场景分割是基于内容的视频检索中的一个重要环节,以镜头为研究对象,根据镜头内容的相关性和时间上的邻近性把语义相似的镜头划分到同一个场景中,将一段完整的视频分割成若干个有意义的逻辑故事单元[1]。国内外学者已对视频场景分割进行了大量研究,主流的视频场景分割方法包括基于规则的方法、基于图的方法和基于多特征融合的方法。其中,基于规则的方法是利用视频制作人员使用的视频规则作为计算镜头相似度的指导从而识别视频场景。CHASANIS等[2]以关键帧表示镜头,用谱聚类和低层颜色特征聚类并根据所属聚类进行标记,使用Needleman-Wunsch算法从符号序列的对齐分数中检测场景边界。但在不严格遵守编辑规则的视频中,或当两个相邻的场景相似且遵循相同规则时,该算法往往会造成场景分割错误。在基于图的方法中,镜头转换图(shot transition graph,STG)[3]模型以节点表示镜头或镜头簇,边缘表示连接节点之间的相似性或时间接近度,应用图形分割算法构造的图形被分成子图,每个子图表示场景。SU等[4]使用颜色和运动特征来表示镜头相似度,通过应用归一化的切分将STG划分为子图。SIDIROPOULOS等[5]引入STG近似的方法,利用视觉和听觉通道的特征。但该方法在对视觉特征和听觉特征相近似的镜头进行聚类时,没有考虑到上下文,从而不利于对生成子图的分析和分割有意义的场景。……