刘三民,孙知信
(1.南京航空航天大学计算机科学与技术学院,南京210016;2.安徽工程大学计算机与信息学院,安徽芜湖241000;3.南京邮电大学计算机技术研究所,南京210003;4.南京大学计算机软件新技术国家重点实验室,南京210093)
近年来对P2P流量识别的研究越来越多,但由于网络应用端口跳变、加密及版本更新和稳私问题使得基于端口识别和特征字段识别方法效率低下。现有研究热点是采用基于机器学习的方案进行流量识别。
文献[1]首次提出用朴素贝叶斯方法进行流量识别,由于流量特征条件独立、服从高斯分布难以满足导致识别效率较低。在此基础上文献[2-3]进行系列改进,如采用核密度估计拟合函数方法和神经网络理论得到较好性能,但仍局限于某些前提的约束。文献[4]采用聚类方法实现流量识别,但难以做到细粒度分类,且需要人的干预。文献[5]采用支持向量机模型进行流量识别研究,并在多个数据集上进行验证。文献[6]构建多维支持向量机模型实现P2P和非P2P流量识别。本文提出基于支持向量数据描述(Support vector data description,SVDD)[7-8]的P2P流量识别模型,其特点是通过SVDD原理求出各类流量样本分布中心,通过比较测试样本距各类中心距离远近实现网络中多种网络流量识别。相比现有机器学习识别方案,该模型原理简单,约束前提条件较少,具有较强的适应能力。理论分析和数据实验表明,该模型具有较高的识别精度,对数据不平衡问题拥有较好的包容性。
根据统计学习理论,具有较小VC维的分类器拥有良好的泛化性能。……