刘瀚锴,黄贤英,朱小飞,付朝燕
(重庆理工大学 计算机科学与工程学院,重庆 巴南 400054)
文本分类是自然语言处理技术中非常重要的领域,被广泛应用于垃圾邮件过滤、新闻分类、情感分析、恶意评论检测等场景。层级文本分类(Hierarchical Text Classification,HTC)是文本分类领域中的一项特殊任务,分类结果对应标签层级结构中的一个或多个节点。如图1所示,标签被分层存储在预先定义好的树形结构中。层级文本分类可用于解决为专利申请分配分类代码[1]、网页分类[2]、表情符号推荐等任务。工业界和学术界对HTC任务都进行了广泛的研究。

图1 预先定义好的标签层级结构Fig.1 Structure of predefined label hierarchy
Fall等[3]提出使用传统分类模型(朴素贝叶斯),将HTC问题简化为平坦的多标签分类问题,直接预测位于最后一级叶子结点的类别。这种简化方法忽略了标签的层级结构信息。为解决这个问题,Read等[4]提出对于每个二分类模型的属性空间都用0或1来拓展,代表之前所有分类器的标记相关性,从而形成分类器链。然而当第一个分类器中的一个或多个预测较差时,分类误差可能会沿链进行传播。同样,Mayne等[5]将独立的朴素贝叶斯分类器组成分层分类器,父分类器的输出概率作为额外特征传播到子分类器,每个分类器都使用二元正态分离进行单词特征选择。Shimura等[6]在学习层级信息的时候,将上层标签信息以微调卷积神经网络的方式传递到下层标签的学习中。Zhou等[7]通过引入先验层级信息和样本分布概率,使用Bi-TreeLSTM和GCN构建层次感知结构编码器来建模标签关系。……