赵 升,赵 黎
(1.昆明医科大学第三附属医院 PET/CT中心,昆明 650118;2.昆明医科大学 基础医学院,昆明 650500)
计算机视觉是一个多学科交叉的领域, 主要研究从静态图像或者视频流中自动提取、分析和理解有价值信息的理论和方法[1]。图像物体识别与检测(图像识别)是指从静态图像或视频流中识别及定位出其中感兴趣的物体,是计算机视觉领域的一个基础性任务。近年来,得益于深度学习理论和方法的长足发展,图像识别也取得了许多新的突破[2-4]。然而,多尺度图像识别依然是一项极具挑战性的任务。一幅图像所包含的物体有大有小,多尺度图像识别旨在可以识别出图像中不同大小的物体。现有的图像识别方法通常对大小适中的物体识别精度较好,对过大或者过小的物体识别精度都较差。多尺度图像识别依然是当前的难点和前沿问题。
当前,基于深度神经网络的物体识别方法可以分为两类:单步骤图像识别方法和双步骤图像识别方法。顾名思义,单步骤图像识别方法只有一个步骤,即通过对位置、比例和纵横比进行常规或密集采样实现物体识别。双步骤图像识别方法分为两个步骤:第一步骤为稀疏物体识别方案集生成模型,第二步骤为方案集中物体识别方法的分类与回归。区别于单步骤图像识别方法,双步骤图像识别方法可输出每个步骤的中间结果以更好地诊断图像识别性能。相较于双步骤图像识别方法,单步骤图像识别方法通常具有较高的计算效率和相对较低的识别精度。……