徐娟 卞良

摘要:为有效拦截、过滤垃圾邮件,本文研究基于SVM的中文垃圾邮件过滤技术。经测试实验表明,该方法能够有效的预测中文垃圾邮件,在准确率、精度、召回率方面表現较优。
关键词:支持向量机算法;中文垃圾邮件预测;中文分词
中图分类号:TP393 文献标识码:A 文章编号:1007-9416(2020)01-0038-02
0 引言
随着互联网技术的高速发展,电子邮件为人们提供便捷地服务,同时随之产生的垃圾邮件也带来了巨大的影响。大量垃圾邮件不仅占用网络带宽,同时也消耗存储空间。不仅影响网络传输和运算速度,同时严重影响邮件服务器的正常工作。
1 相关技术
1.1 中文分词技术
我们采用jieba分词进行中文语句切分,jieba分词是一种结合基于规则和基于统计这两类方法的分词工具,它提供全模式、搜索引擎模式以及精确模式三种分词方式。全模式主要目标是扫出所有可以成词的词语,分词力度较细。搜索引擎模式,适合用于搜索引擎分词。除了可以进行分词外,它还可以进行词性标注。精确模式分词适用于文本分析。
1.2 垃圾邮件过滤技术
目前垃圾邮件过滤主要是黑白名单过滤、基于规则过滤和基于内容统计过滤三种方式。朴素贝叶斯、支持向量机、最近邻等算法是基于内容统计的过滤方式。
黑白名单是一种被广泛应用的垃圾邮件过滤技术。黑名单主要基于拒绝列表,首先将目标邮件的Email地址、IP地址或域名加入拒绝列表,也称“黑名单”,当邮件服务器接收到新邮件时,先到拒绝列表上查找。……