摘 要:中文分词属于自然语言处理技术子集,对中文分词技术的研究由来已久,文章基于Python结巴分词,从概述、分类、方法、挑战、应用及现状等对中文分词技术进行探究,旨在抛砖引玉,以供借鉴。
关键词:分词;中文分词;Jieba;自然语言处理
1 中文分词技术的概述
在汉语语言学界,“词”这一概念一直是个缠绕不清、不可逾越的问题。“词是什么”(词的抽象定义)和“什么是词”(词的具体界定),这两个基本问题迄今为止还没有得到一个权威、明确的表述,很难找到能引起大众共鸣的词表。众所周知,相对于以英文为代表的拉丁语系语言,英文使用空格作为自然的分隔符,而中文由于继承了古代汉语的传统,词与词之间并无分隔[1]。而在现代汉语中则以双字或多字占多数,一个字再也不等同于一个词,如果把字作为分词的最小单位,它的粒度太小,不能表达完整的意思,而句子的粒度太大,承载的信息太多,很难重复使用。通俗地说,中文分词就是由机器在中文文本中的词和词之间自动添加分界线,是中文信息处理的基础,是自然语言处理(NLP)的子集,其实质就是划界。
2 中文分词技术的分类
经过近30年的探究,中文分词从提出到现在,已经提出了很多方法,如规则分词、统计分词和混合分词。但至今还没有推出一套很好的中文分词系统。规则分词是最早出现的一种分词方法,主要通过人工建立词库,按照一定的方式进行匹配切分,操作简单,效率高,但是难以处理新词。……