视觉问答研究综述∗

2021-11-09 02:45:52包希港周春来肖克晶
软件学报 2021年8期
关键词:特征文本模型

包希港,周春来,肖克晶,覃 飙

(中国人民大学 信息学院,北京 100872)

视觉问答任务是人工智能领域一项具有挑战性的任务,其属于计算机视觉和自然语言处理的交叉方向.然而在此之前,计算机视觉和自然语言处理是分开发展的,在各自的领域取得了重大的进步.随着计算机视觉和深度学习的不断发展,许多计算机视觉任务取得了巨大的进展,如图像分类[1,2]、物体检测[3,4]和动作识别[5,6].但是上述任务只需对图像进行感知,不需要对图像进行整体的理解和推理.图像字幕任务[7−9]首先将两个领域结合起来,利用图像和文本作为输入训练模型以描述图像中的内容.

文本问答系统[10,11]在自然语言处理领域已经有了广泛的研究,不论是科研界还是工业界都有众多成果涌现,如淘宝的智能客服.随着问答系统在自然语言处理领域的成功应用,有研究提出将问答系统应用至视觉领域.随着自媒体的不断发展,图片和视频的数据量爆炸性增长,图片和视频等视觉信息的表达能力和信息涵盖能力比文本更强,如何通过交互式的方法从视觉信息中提取信息、过滤信息以及推理信息,成为了一个亟需解决的问题,视觉问答任务在这一背景下被提出.

视觉问答任务是以图像(或视频)和与图像(或视频)有关的文本问题的多模态信息作为计算机的输入,计算机根据图片得到问题的正确答案.本文的内容主要是对基于图片的视觉问答任务进行总……

登录APP查看全文

猜你喜欢
特征文本模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
当代陕西(2019年10期)2019-06-03 10:12:04
基于doc2vec和TF-IDF的相似文本识别
电子制作(2018年18期)2018-11-14 01:48:06
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
语文知识(2014年1期)2014-02-28 21:59:13
线性代数的应用特征
河南科技(2014年23期)2014-02-27 14:19:15