张海玲,邵玉斌,贾继康,龙 华,杜庆治
(昆明理工大学信息工程与自动化学院,云南 昆明 650500)
随着信息时代的潮流发展,人们对自然语言处理NLP(Natural Language Processing)的研究也更加如火如荼。 NLP是一个交叉学科,涉及的技术范畴众多,例如语音合成与识别、句法分析和语言模型[1 - 3]等,现已广泛集成到Web和移动应用程序中,帮助实现人与计算机之间的自然交互,显然已是信息社会中不可或缺的一部分。句法分析是自然语言处理中的关键技术之一,其基本任务是确定句子所包含的句法单位和这些句法单位之间的依存关系。宾州中文树库CTB(Chinese TreeBank)[4]的发布,不但为汉语句法分析提供了一个公共的训练、测试平台,也促进了句法分析的发展,使得句法分析成为自然语言处理应用的关键因素,在机器翻译、问答系统、信息检索与抽取和语音识别等领域都有重要的应用价值[5]。
句法分析的研究主要有基于统计和规则的方法[6,7]。由于语种的特点,特别是汉语,大部分句法分析的研究都处在字、词、语块的阶段,在语句成分方面的研究甚少[8]。虽然目前已有多个原本为英语制定的句法分析模型被移植到CTB上来[9],但是还存在以下问题:中文不具有诸如英语、法语等其他语言那样严格意义的形态变化[10,11],忽略了汉语的局限性及特点。若针对某一类语料构建句法分析器,那么该句法分析器对该类型句子的句法分析效果较为显著[12],但若用该句法分析器对通用语料进行句法分析,其效果就会大打折扣。……