谢金宝 李嘉辉 康守强 王庆岩 王玉静
①(广东科学技术职业学院机器人学院 珠海 519090)
②(哈尔滨理工大学电气与电子工程学院 哈尔滨 150000)
文本分类是自然语言处理中一项重要的基础工作[1],具有广泛的应用场景,例如垃圾邮件过滤、商品情感分类等。过去使用传统的机器学习方法进行文本分类。近年来,循环神经网络(Recurrent Neural Netword,RNN)和卷积神经网络(Convolutional Neural Network,CNN)等深度学习网络在文本分类任务中取得了很好的进展[2]。与传统方法不同的是,深度学习方法能自主学习文本的深层语义特征。长短时记忆网络(Long Short-Term Memory,LSTM)是一种改进的RNN,可以有效地捕获文本的上下文信息,CNN能够捕获文本的局部特征。为每个领域的文本训练效果好的分类模型需要大量标记样本,由于手工注释是很耗时的,因此很难获得。为解决此问题,很多研究者采用域适应方法[3]有效利用标签数据进行文本分类。迁移学习过程中,当源域和目标域数据分布不同但任务相同时,这种特殊的迁移学习为域适应学习。在文本分类任务中,一个领域的数据不足时,利用资源丰富的源域学习到的知识去学习,减少领域之间的差异,提高领域文本分类的准确率。不同的是,假设每个领域的标记数据不足以训练出一个准确的单一领域情感分类器。我们研究多任务学习方法[4],从多个领域中提取共享的特征,把各个任务的信息利用起来,使用有限的标记样本训练一个比单一领域分类器性能更好的分类器。Liu等人[5]开发出一种结合语义分类和信息检索任务的多任务学习模型,采用词袋模型会丢失很多语义信息,共享一个深度神经网络(Deep Neural Network,DNN)隐藏层很难得到文本的高层次语义信息。……