胡吉明 田沛霖
(1.武汉大学信息管理学院 武汉 430072;2.武汉大学信息检索与知识挖掘研究所 武汉 430072)
文本智能计算是依托于人工智能、自然语言处理等大数据管理和分析技术,所形成的体系化的智能计算解决方案[1],是文本处理领域的全新计算模式,囊括了信息分析、自然语言处理、深度学习等领域的大量技术创新,能够揭示大规模非结构化文本数据的语义内涵,从而为决策提供智力支持。传统情报学文本计算方法已无法满足大数据时代下不断提升的文本处理需求,以及智能计算方法的不断发展,促使文本智能计算成为当前文本处理研究的重要方向与热点课题。
1958年Luhn将词频统计与句子显著性因子计算的方法应用于自动摘要生成[2],开创了文本智能计算研究的先河。1991年Dubois研究了基于模糊集的近似推理语义方法[3],进一步推动了文本智能计算研究的发展,自此之后研究规模开始发展壮大。近年来国际学者从多种细分领域对其进行研究,取得了丰富的成果,并广泛涉及社会诸领域,为舆情分析、情感计算、迁移学习、金融市场等领域提供了技术支持[4-7]。
在对文本智能计算及其子领域研究进展与发展态势的研究中,一方面,部分学者采用内容分析等定性分析方法,指出当前面向技术路径识别的文本挖掘方法主要有语义增强、文本聚类等,未来会加强面向多源数据的多元关系融合研究[8];基于图神经网络的方法在文本特征提取中将会愈发受追捧[9];……