孙铭一 孙刘杰 李佳昕
上海理工大学
出版印刷与艺术设计学院
上海 200093
图像风格转换是近年来机器视觉领域的研究重点之一。根据图像风格转换模型在训练中是否需要成对的数据,其可分为有监督学习和无监督学习。有监督学习需要成对的数据和人工对数据打标签,导致时间成本过高。无监督学习不需要成对的数据,相较于有监督学习,其数据获取更加简单高效,普适性更高。根据一张输入图像是否能够对应获得多个输出图像,图像风格转换模型可分为单模态模型和多模态模型。在单模态模型中,一张输入图像只能获得一张对应的输出图像,当输入数据不成对时,其局限性便体现在模型的输出结果不确定上。在多模态模型中,一张输入图像可以对应多张输出图像,因而多模态模型能够很好地应对多图像转换任务,例如包装平面设计[1]、文图转换等。
近年来有关多模态无监督图像风格转换的研究越来越多,这些研究都是基于生成对抗网络[2](generative adversarial networks,GAN)。Choi Y.等[3]提出了人脸图像多模态转换模型StarGAN,Yu X. M.等[4]提出了SingleGAN。StarGAN使用星形生成网络结构并在输入中添加目标领域信息,再结合判别器的分类结构和循环重构一致性约束完成图像翻译工作。但是其欠缺对图像重构损失的考虑,因而图像风格转换时某些固定属性会发生变化,导致图像质量下降。SingleGAN则采用类别便签指导方法,在StarGAN的基础之上对网络结构作出改进。2018年,Huang X.等[5]提出的MUNIT和Lee H. Y.等[6]提出的DRIT,均是基于内容与风格分离编码再交叉解码的方法以获得多样的输出。……