林懿伦 戴星原 李力 王晓 王飞跃
近年来,人工智能领域,特别是机器学习方面的研究取得了长足的进步.得益于计算能力的提高,信息化工具的普及以及数据量的积累,人工智能研究的迫切性和可行性都大为提高.以Google等为代表的IT企业,利用其掌握的海量数据资源,结合新的硬件结构和人工智能算法,实现了一系列新突破和新应用,并获得了可观的收益.这些企业获得的成功进一步带动了机器学习的研究热度,使得人工智能的研究进入了一个新的高潮时期.
在此次的人工智能浪潮中,以统计机器学习,深度学习为代表的机器学习方法是主要的研究方向之一.相比符号主义的研究方法,基于机器学习的人工智能系统降低了对人类知识的依赖,转而使用统计的方法从数据中直接习得知识.机器学习理论是一次重要的范式革命,使人工智能领域的研究重点从算法设计转向了特征工程与优化方法.
一般而言,依据数据集是否有标记,机器学习任务可被分为有监督学习(又称预测性学习,数据集有标记)与无监督学习(又称描述性学习,数据集无标记)[1].随着数据收集手段,算力与算法的不断发展,在诸多监督学习任务中,如图像识别[2−3],语音识别[4−5],机器翻译[6−7]等,机器学习方法,特别是深度学习方法都取得了目前最好的成绩.
然而,有监督学习需要人为给数据加入标签.这带来了两个问题:一是数据集采集后需要大量人力物力……