赵维纳,李 琳,刘汇丹,普布顿珠, 吴 健
(1. 青海师范大学,青海 西宁 810008;2. 中国科学院软件研究所,北京 100190;3. 中央民族大学,北京 100081)
藏语三音动词短语自动抽取研究
赵维纳1,2,李 琳1,刘汇丹2,普布顿珠3, 吴 健2
(1. 青海师范大学,青海 西宁 810008;2. 中国科学院软件研究所,北京 100190;3. 中央民族大学,北京 100081)
藏语三音节复合动词短语(以下简称三音动词短语)能产性强,使用频率高,结构不稳定,给藏语文本处理带来很多麻烦。针对这些特点,该文提出了一种统计和规则相结合的三音动词短语的自动抽取算法。首先,从三音动词短语的结构出发,以构成三音动词短语的动语素作为标志,获得三音动词短语候选项。然后,利用统计算法和语言规则库对候选项进行过滤,获得三音动词短语。实验结果表明,统计和规则结合的方法可以有效地从未经标注的藏语语料中获取三音动词短语。
中文信息处理;藏语信息处理;词汇获取;藏语三音节复合动词短语
藏语三音动词短语是指由双音节名词或形容词与单音节动语素构成的动词短语,这种结构在较早的历史文献中也存在,但是数量不多。然而在现代藏语中这种现象大量产生[1]。三音动词短语的识别问题已经影响到藏语自动分词、组块分析、句法分析以及机器翻译等各领域的研究。由于它具有开放性、能产性、数量的不确定性以及结构的不稳定性等特点,三音动词短语的识别与抽取目前还没有较好的处理策略。如何从大规模真实语料中自动获取三音动词短语是一项值得探索的课题。……