面向规范性文件的基于BERT的文本纠错模型

2022-06-07 06:14:52汪苏琪王明文曾雪强
山西大学学报(自然科学版) 2022年2期
关键词:规范性文本模型

汪苏琪,王明文,曾雪强

(江西师范大学 计算机信息工程学院,江西 南昌 330022)

0 引言

行政规范性文件是各级机关、团体、组织制发的各类文件中最主要的一类,因其内容具有约束和规范人们行为的性质,故名称为规范性文件。它具有数量大、权威性强等特点,这类文件的文本往往是需要反复审核之后才能发表的,劣质的行政规范性文件会侵犯公民、法人和其他组织的合法权益,更会极大地损害当地政府公信力。因此,辅助有关工作人员对行政规范性文件进行文本纠错就具有了现实意义。

在中文文本纠错任务领域,易蓉湘等[1]提出了中文基于规则的查错方法,对错误的中文文本进行归纳,得到错误规则的模板,积累了这些规则之后,再将可能的错误句子与模板进行对比,检索出错误词。该查错方法的准确率较高,但是由于错误规则模板不可能面面俱到,其他不符合错误规则模板的错误无法检错,因此召回率很低。张仰森等[2]选择以规则和统计相结合的方式对政治新闻的文本进行纠错,首先得到一个以政治语言为特征的错误规则模板,再结合规则与统计的方法实现文本纠错。卓利艳[3]的中文文本自动校对系统使用的方法是条件随机场和N-gram[4]模型,将文本进行错误类型分类,最后再以规则、统计的方式进行纠错。

近年来,已有的文本纠错研究工作大部分以 seq2seq[5](Sequence to Sequence,序列到序列的模型)模型框架为基础,进行文本纠错。他们把文本纠错任务当作机器翻译任务来处理,它的主要思路是把文本纠错问题看成同一类语言的翻译问题,即把错误文本翻译为正确文本,主要实现方法是基于注意力机制的Encoder-Decoder模型。……

登录APP查看全文

猜你喜欢
规范性文本模型
一半模型
重尾非线性自回归模型自加权M-估计的渐近分布
自然资源部第三批已废止或者失效的规范性文件目录
矿产勘查(2020年7期)2020-01-06 02:03:17
在808DA上文本显示的改善
基于doc2vec和TF-IDF的相似文本识别
电子制作(2018年18期)2018-11-14 01:48:06
作为非规范性学科的法教义学
法律方法(2018年3期)2018-10-10 03:20:38
我国知识产权判例的规范性探讨
知识产权(2016年1期)2016-12-01 06:56:38
3D打印中的模型分割与打包
文本之中·文本之外·文本之上——童话故事《坐井观天》的教学隐喻
如何快速走进文本
语文知识(2014年1期)2014-02-28 21:59:13