基于关键词学习的文本分类方法

2019-03-21 01:31:18
山东师范大学学报(自然科学版) 2019年1期
关键词:特征文本模型

(1) 山东师范大学信息科学与工程学院,250358,济南; 2)山东超越数控电子股份有限公司,250013,济南)

1 引 言

计算机技术的发展和网络的普及,加速推进了信息化时代的进程,同时也造成了文本数据爆炸式增长、文本处理工作负荷加大等现象,为此很多学者开始关注文本分类问题.文本分类是指根据文档的主题、内容或属性,将大量的文本划分到一个或多个类别的过程.文本分类的主要方法包括传统的机器学习模型和神经网络模型[1,2].目前大量的机器学习方法应用于文本分类系统中,如基于贝叶斯定理与特征条件独立假设的朴素贝叶斯法[3-5]、建立在统计学习VC维理论和结构风险最小原理基础上的支持向量机方法[6,7]、运用概率与图论中的树对决策中的不同方案进行比较从而获得最优方案的决策树法[8],此外还有最小二乘法、K最近邻法[9]等.[10]上述算法虽然模型较为简单,但是对文本词语的上下文关系潜在语义关系考虑不够充分,分类效果仍有待提高.

为了更准确地将未知文本标记为正确的类别,不仅需要文本分类方法不断改进,还需要使文本表示方法更加合理,使关键词可以更全面地代表文本信息.近些年深度学习的不断发展为解决大数据问题提供了新方向,使用基于深度学习的方法可更好地挖掘蕴含在文本中复杂的语义关系,从而更好解决文本处理的相关问题.[11]本文引入卷积神经网络和BP神经网络的混合网络对文本的关……

登录APP查看全文

猜你喜欢
特征文本模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
如何表达“特征”
在808DA上文本显示的改善
不忠诚的四个特征
当代陕西(2019年10期)2019-06-03 10:12:04
基于doc2vec和TF-IDF的相似文本识别
电子制作(2018年18期)2018-11-14 01:48:06
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
语文知识(2014年1期)2014-02-28 21:59:13
线性代数的应用特征
河南科技(2014年23期)2014-02-27 14:19:15