基于SVM的中文垃圾邮件预测系统研究

2020-04-21 07:40:59徐娟卞良
数字技术与应用 2020年1期

徐娟 卞良

摘要:为有效拦截、过滤垃圾邮件,本文研究基于SVM的中文垃圾邮件过滤技术。经测试实验表明,该方法能够有效的预测中文垃圾邮件,在准确率、精度、召回率方面表現较优。

关键词:支持向量机算法;中文垃圾邮件预测;中文分词

中图分类号:TP393 文献标识码:A 文章编号:1007-9416(2020)01-0038-02

0 引言

随着互联网技术的高速发展,电子邮件为人们提供便捷地服务,同时随之产生的垃圾邮件也带来了巨大的影响。大量垃圾邮件不仅占用网络带宽,同时也消耗存储空间。不仅影响网络传输和运算速度,同时严重影响邮件服务器的正常工作。

1 相关技术

1.1 中文分词技术

我们采用jieba分词进行中文语句切分,jieba分词是一种结合基于规则和基于统计这两类方法的分词工具,它提供全模式、搜索引擎模式以及精确模式三种分词方式。全模式主要目标是扫出所有可以成词的词语,分词力度较细。搜索引擎模式,适合用于搜索引擎分词。除了可以进行分词外,它还可以进行词性标注。精确模式分词适用于文本分析。

1.2 垃圾邮件过滤技术

目前垃圾邮件过滤主要是黑白名单过滤、基于规则过滤和基于内容统计过滤三种方式。朴素贝叶斯、支持向量机、最近邻等算法是基于内容统计的过滤方式。

黑白名单是一种被广泛应用的垃圾邮件过滤技术。黑名单主要基于拒绝列表,首先将目标邮件的Email地址、IP地址或域名加入拒绝列表,也称“黑名单”,当邮件服务器接收到新邮件时,先到拒绝列表上查找。……

登录APP查看全文