杨 泉
(北京师范大学 汉语文化学院,北京 100875)
自然语言处理中的短语结构语法关系判定是一项重要的基础性研究工作,其结果对于机器翻译、信息抽取、情感分析等诸多实际应用系统的处理效果至关重要[1]。短语层级语法关系判定问题实质上就是在一个短语结构可能存在的诸多语法关系中判定出正确的一个,因此是一种分类问题,可以通过机器学习算法予以解决。然而当前对于短语层级语法关系自动判定的研究较少,特别是用人工智能算法对短语语法关系做分类判断的研究更不多见。其主要原因可能是因为大部分机器学习方法都不能直接处理原始的语言文本,需要根据语言学知识将文本转化为适合机器学习算法使用的形式,比如词语向量化、文本特征标记等。
N1+N2结构是由2个名词组成的汉语短语结构,也是中文信息处理中的高频语言现象。当其中的N1与N2实例化为不同名词时,该结构可能会产生4种不同的语法关系:并列关系、定中关系、复指关系和主谓关系[2-3]。从这个角度来说,对于N1+N2结构语法关系判定问题可以转化为对某条语料可能存在的语法关系的分类判定问题,本文拟以此结构为例探讨如何用机器学习领域的分类方法判断汉语短语结构的语法关系。
随机森林(random forest)[4]是一种常用于解决分类问题的有监督非参数化机器学习方法[5-6],其核心思想是用随机化方法构建决策树(decision tree)[7]。该算法不需要先验知识,只需训练样……