胡正委,朱 明
(中国科学技术大学 信息科学与技术学院,合肥 230031)
近年来,深度学习被用于很多领域.如人脸识别,对象检测等[1–4].深度学习可以从大量的数据捕捉有用的信息,同时也由于大数据时代的来临与计算设备性能的提高,使深度学习的应用成为现实.VGG[1,5]模型起初被用于物体识别,然后被扩展到人脸识别等任务中.GoogleNet[6]提出的Inception结构,使用多个小尺寸的卷积核来代替大尺寸卷积核,减少了网络参数,也提高了模型性能.Resnet[7]的提出很大程度上改进了传统的网络结构,并在Imagenet上获得最好的效果.通过迁移学习[8],这些网络模型也已经被广泛地应用到了各种识别任务中.同时,对象识别任务逐渐扩展到对象检测任务,即从单个对象的分类扩展到了多个对象的分类和定位.Faster RCNN[3]及其扩展版本成为近年来最有效的方法之一.
然而若将上述方法迁移到新的任务中,都需要在新的任务上使用大量标定数据重新调整模型.但是,在实际场景中,数据的标定是非常难的工作,需要消耗很大的财力物力和人力[9].Vinyals,Koch[10,11]等人开始致力于研究如何在仅有少量训练样本甚至没有训练样本时进行分类工作.然而相比较于分类任务的数据标定,检测任务中边框定位数据的标定更难获得.如何在没有边框标定数据的情况下,将分类任务迁移到检测任务也是目前研究的难点.
本文提出一种方法,解决了数据瓶颈问题,可以在无需边框标定的情况下进行商品的检测……