董俊杰,刘华平,谢珺,续欣莹,孙富春
(1.太原理工大学 信息与计算机学院,山西 晋中 030600;2.清华大学 智能技术与系统国家重点实验室,北京 100084;3.太原理工大学 电气与动力工程学院,山西 太原 030024)
近年来,图像分类[1-2]、目标检测[3-6]、语义分割[7-8]、实例分割[9-10]等视觉识别任务取得了巨大的进展。计算机视觉系统的性能在精度上越来越接近于甚至超过人类水平。尽管如此,人类的视觉系统具有感知物体完整物理结构的能力,即使物体在部分遮挡甚至重度遮挡的情况下也能准确预测物体的形状,这种能力被称为非模式感知[11](即amodal perception),使得人类对物体的不可见的、被遮挡的部分进行推理,针对遮挡有一定的鲁棒性,从而仅在部分可见的情况下感知物体完整形状和语义概念。
在非模式实例分割[11]的任务中,amodal masks定义为物体visible masks 和occlusion masks 的并集。预测amodal mask 和visible mask 可以加深对场景的理解;例如,非模式感知可以使自动驾驶汽车能够在视觉范围内推断出车辆和行人的整体形状,即使其中的一部分是看不见的,这能够显著降低碰撞的风险;还有机器人在拾取或放置对象时,需要知道对象是否被一个或多个其他对象所遮挡,通过对被遮挡部分的感知计算遮挡区域,然后指导机器人朝哪个方向移动或者将某些对象移除,帮助机器人获取感兴趣对象的完整结构和语义。
预测物体的不可见部分是非常具有挑战性的。一个计算机视觉系统如果要感知物体被遮挡、不可见部分的形状和语义概念,首先需要识别和定位这个物体,这涉及到了目标检测的技术;……