庄福振 钱明达 申恩兆, 张大鹏 何 清
(1.中国科学院计算技术研究所智能信息处理重点实验室,北京,100190; 2.燕山大学信息科学与工程学院,秦皇岛,066004)
机器学习作为人工智能的主体与核心,各种机器学习算法已经应用到各个领域,如语音识别、图片分类、推荐系统、手写输入识别和漏洞发现等,极大地提高了计算机智能化程度和各种系统的性能。实际应用中许多数据并不能很好地表示数据规律,甚至对系统的学习产生副作用,这就需要获得好的特征表示来改进算法的性能。然而随着计算机以及互联网的不断发展,信息量不断增大,信息复杂度也不断提升,数据包含的信息日益庞杂、冗余,良好的特征工程成为影响机器学习成败的关键因素。如何取得数据良好的特征表示,进而提升机器学习算法性能已经成为机器学习中一个关键的问题。
特征学习(Feature learning)又称作表示学习(Representation learning),是机器学习领域中的一个重要研究问题,它的目标是自动地学习一个从原始输入到新特征表示的变换,使得新特征表示能够有效应用在各种学习任务中,从而把人从繁琐的特征工程中解放出来。根据训练过程是否需要有标签数据,可以把表示学习算法分为两类:有监督特征学习和无监督特征学习。在有监督特征学习中,通常需要利用有标签数据,比如有监督字典学习。无监督特征学习中,不需要数据具有标签,比如主成分分析、 独立成分分析、 自动编码机、矩阵分解[1]以及众多形式的聚类算法[2-3]。……