基于双向长短时记忆模型的中文分词方法*

2017-06-21 15:07:18张洪刚李焕
华南理工大学学报(自然科学版) 2017年3期
关键词:实验信息模型

张洪刚 李焕

(北京邮电大学 信息与通信工程学院, 北京 100876)

基于双向长短时记忆模型的中文分词方法*

张洪刚 李焕

(北京邮电大学 信息与通信工程学院, 北京 100876)

中文分词是中文自然语言处理中的关键基础技术之一.目前,传统分词算法依赖于特征工程,而验证特征的有效性需要大量的工作.基于神经网络的深度学习算法的兴起使得模型自动学习特征成为可能.文中基于深度学习中的双向长短时记忆(BLSTM)神经网络模型对中文分词进行了研究.首先从大规模语料中学习中文字的语义向量,再将字向量应用于BLSTM模型实现分词,并在简体中文数据集(PKU、MSRA、CTB)和繁体中文数据集(HKCityU)等数据集上进行了实验.实验表明,在不依赖特征工程的情况下,基于BLSTM的中文分词方法仍可取得很好的效果.

深度学习;神经网络;双向长短时记忆;中文分词

中文分词是中文自然语言处理中的关键基础技术之一,是其他中文文本任务(如命名实体识别、句法分析、语义分析等)的前期关键处理环节,其分词的准确性对中文自然语言处理尤为重要.

传统机器学习方法在中文分词领域取得了飞速发展,有着丰富的分词算法,如最大正向匹配、最大逆向匹配、双向匹配等基于词典的方法.基于词典的分词算法针对输入的中文句子,通过与词典进行对比,将输入的中文句子分成单字或多字组成的词,从而达到分词的目的.然而,由于中文句子是连续的文字,存在大量的歧……

登录APP查看全文

猜你喜欢
实验信息模型
一半模型
记一次有趣的实验
重尾非线性自回归模型自加权M-估计的渐近分布
做个怪怪长实验
订阅信息
中华手工(2017年2期)2017-06-06 23:00:31
3D打印中的模型分割与打包
NO与NO2相互转化实验的改进
实践十号上的19项实验
太空探索(2016年5期)2016-07-12 15:17:55
展会信息
中外会展(2014年4期)2014-11-27 07:46:46
健康信息
祝您健康(1987年3期)1987-12-30 09:52:32