贾延延,程学旗,冯 键
(1. 中国再保险(集团)股份有限公司 博士后科研工作站,北京 100033;2. 中国科学院 计算技术研究所,北京 100190;3. 中国再保险(集团)股份有限公司 信息技术中心,北京 100033)
篇章是由词、短语、句子和段落构成的自然语言单位,是一个有组织和层级的整体,可以表达完整的思想和意图。篇章具有连贯性(Coherence)、衔接性(Cohesion)、信息性(Informativity)、意图性(Intentionality)、情景性(Situationality)、可接受性(Acceptability)和跨篇章性(Intertextuality)等7种特性[1]。
基于修辞结构理论(Rhetorical Structure Theory, RST)[2]的篇章结构分析是篇章连贯性分析中的一个重要分支。在RST理论中,基本篇章分析单元(Element Discourse Unit, EDU)之间存在修辞关系。篇章成分分析通过这种修饰关系自底向上地合并分析单元,形成中间节点,直到建立包括整篇文章中所有EDU的篇章成分分析树。目前,绝大多数篇章分析工作都采用成分分析模式。几乎所有针对英语的篇章成分分析工作都基于经典的修辞结构理论篇章树库(RST DT)[3]。例如,Hernault等[4]提出了基于支持向量机的篇章成分分析器HILDA,他们采用二分类器进行结构分析,用多分类器预测修辞关系和核心附属属性,借助位置、长度、距离、句法分析结果、支配集等特征自底向上地建立成分分析树;Feng等[5]为提升HILDA的分析效果,引入丰富的语言学特征。例如,规则、依存结构、语义相似度、支配节点、上下文信息等特征,构造了多达21 410个特征模板,通过互信息评价特征的贡献将其排序;Li等[6]借助斯坦福自然语言处理工具获得句法树结构,利用递归神经网络获得EDU和中间分析单元的向量表示,再基于神经网络的分类器分别判断篇章分析树结构和修饰关系。……