王金彪, 周 伟, 王 澍
(上海飞机设计研究院,上海 200235)
近年来,集成学习是机器学习中的一个研究热点,它通过训练多个基分类器,并将结果按一定的方法进行集成,可以显著地提高分类系统的泛化能力,许多学者对其进行了广泛的研究,许多学者开始致力于研究集成学习的理论基础和进行算法设计[1-2]。
支持向量机 (Support Vector Machines,SVM)是基于统计学习理论的一种适合高维、小样本数据分类的学习器。和传统的学习机器相比,它可以获得和可利用样本相匹配的学习能力,从而可以具有很好的推广能力,在模式识别方面有很重要的应用[3]。SVM具有较好的泛化能力和稳定性(其结果不随训练次数发生变化)。但是实际应用中SVM也有一些缺点:首先,SVM训练问题实际上是一个凸二次优化问题,在解优化问题是采用了逼近算法,这会使结果不准确;其次,SVM的性能很大程度上取决于核函数和模型参数的选择,目前还没有一个特别有效的方法可以准确找到最优参数,这也会导致支持向量机的训练结果不是最优的。
本文拟通过集成学习的方法来提高支持向量机的泛化能力,提高支持向量机的识别精度,并应用到故障诊断中。
集成学习一般包含3个要素:基分类器类型、基分类器生成方法和结论生成方法。常用的基分类器有决策树、K近邻分类器、神经网络、支持向量机等。基分类器可以为同种类型,也可以为不同类型,分别称为同构集成和异构集成,其中同构集成为研究重点,异构集成研究得较少。……