李希亮, 李栋梁, 张 玲, 董晓娜, 吴丹桐,李 霞, 金 鹏, 赵小贺
(1. 山东省地震局, 山东 济南 250014; 2. 潍坊市地震局, 山东 潍坊 261041)
统计学习理论(Statistical Learning Theory) 是一种专门研究小样本统计的理论, 隶属于计算机科学、 模式识别和应用统计学相交叉与结合的范畴, 也是一种专门针对有限样本预测问题的纯理论分析工具。 随着统计学习理论的不断完善和发展, 产生了一种有效的机器学习方法—支持向量机(Support Vector Machine, 简称SVM[1]。 支持向量机是基于统计学习理论的新一代学习算法[2~4], 它不但能较好地解决以往困扰很多学习方法的小样本、 过学习、高维数、 局部最小等实际难题, 而且还具有很强的泛化(预测)能力。 SVM 在解决小样本、非线性及高维模式识别问题中表现出许多特有的优势, 并能够推广应用到函数拟合等其他机器学习问题中, 目前已经在文本分类、 手写识别、 图像分类和生物信息学等领域中都取得了成功的应用, 在解决非线性地球物理反演问题中也有显著成效。
SVM 分类是从线性可分情况下的最优分类面发展而来的。 假如两类样本(训练集)是线性可分的, 那么机器学习的结果就是一个超平面(二维情况下是直线)或者称为判别函数,该超平面可以将训练样本分为正、 负两类。
按照结构风险最小的要求, 最优超平面不但要将两类训练样本正确分开, 而且还要使分类间隔最大, 事实上就是对推广能力的控制, 这正是SVM 的核心思想之一。 分类间隔是指两类中离分类超平面最近的样本且平行于分类超平面的两个超平面间的距离, 或者说是从分类超平面到两类样本中最近样本的距离的和。……