张素素,倪建成,周子力,侯 杰
(曲阜师范大学软件学院,山东曲阜273165)
(∗通信作者电子邮箱nijch@163.com)
图像生成任务近年来已成为计算机视觉领域的研究重点,传统的拍摄技术易受到时空的限制,无法凭空产生不存在的事物。深度学习中的图像生成技术不仅能自动为艺术家和用户生成图像,有助于视觉理解,而且还推动了跨视觉-语言推理的研究[1],因此,准确有效地生成高分辨率图像成为目前研究的关键问题之一。
传统的图像生成主要采用非参数化生成模型和参数化生成模型:非参数化生成模型的基本思想是从数据库中匹配图像块,主要应用于图片纹理合成和半自动图像修复;参数化的图像生成技术中的自回归方法[2]调节所有先前像素上的每个像素为概率似然建模。由于传统模型直接用数据样本进行参数更新,公式推导较繁杂且模型计算量较大。
近年来,深度学习在图像生成领域取得了较好的成果,变分自编码器(Variational Auto-Encoder,VAE)[3]使用变分推理联合学习编码器和解码器到隐码和图像的映射。随后,级联优化网络(Cascaded Refinement Network,CRN)[4]使用多个分辨率倍增的模块,从真实语义分割图生成街景的高分辨率图像。图像-图像翻译模型[5]进一步使用输入-输出图像对作为训练数据,将输入图像转换为另一个图像域。目前,生成对抗网络(Generative Adversarial Network,GAN)是最常用的生成模型,其联合学习生成器和判别器。基于GAN的图像生成通常以文本为输入,已在简单数据集上(如鸟、花和人脸)生成了逼真的个体图像,但在包含多个对象和场景信息的数据集上难以生成高质量的复杂图像。……