褚金鹏 刘昕武 唐超伟 曹德洪


摘要:历史故障记录数据对产品的质量分析和提升有重大意义。现存大量由售后人员手动录入的故障及维护记录,带有强烈的个人风格,标准化缺失。一方面提升售后数据的分析难度,另一方面也会因错误信息的存在而降低数据价值。为解决上述问题,此处给出一种基于文本结构和关键词的售后文本分类方法。首先,采用经典分词方法对文本进行分词,然后基于临近词的条件关系,提出一种基于字词信息熵增益的临近词关联方法,针对专业售后文本提出更优的关键词提取方法;在该分词方法的基础上,利用TF-IDF算法筛选关键词,利用关键词和词性的统计分布特征,建立文本的评价特征;最后以少量标记文本为训练样本,采用决策树进行模型训练,实现全量文本的分类算法。实验结果表明,基于熵信息的词关联方法有效提升分词准确性,提取的文本特征和训练的模型在文本的分类筛选上表现良好。
关键词:售后故障数据;熵增益;TF-IDF;决策树;文本分类
引言
文本数据的分析需求不仅存在于工业界,也是学术界一直都关注的热点之一。这方面的研究工作很多。按照应用领域划分,有互联网的汉语术语提取研究[1],按照方法划分则有基于中文词语的结构定义研究[2],也有纯粹按照统计方法的分词研究[3].一系列研究成果表明,文本的分析和评价方法都是从字到词再到段落再到文章的顺序开展。
方……