王朝霞 姜军 冯炎
摘要:面对海量Web舆情信息数据资源,在前期探索其演化规律及影响因素研究基础上,该文对Web舆情信息数据进行了特征分析,结构化定义,设计了Web数据分析系统框架,并深入了相关技术研究,为把握Web数据发展态势,科学管理互联网数据信息提供了可行性依据。
关键词:Web数据;数据挖掘;文本分类;文本聚类
中图分类号:G206 文献标识码:A 文章编号:1009-3044(2018)03-0022-03
1 概述
互联网及相关技术地快速发展,产生了海量的网络数据信息,面对千变万化的网络数据资源,单纯采用传统的手工检索、收集、分析、处理方法,已经无法满足网络数据管理需求。本文在已有的网络信息演化阶段、影响因素等研究基础上[1],构建了网络数据模型,设计了网络数据分析系统框架,并研究了技术路线,为快速抽取网络数据信息,有效把握其发展态势,方便实现科学管理提供了可行性依据。
2 相关研究述评
饶元等Web数据网络分析主要从社区网络分析、整体网络分析和个体网络中心开始,主要采用数据网络分析手段、方法来解决系统分析的主要问题[2]。庞宇提出了网络数据的特点及主要载体[3]。郑琳提出了Web用户评论中同阶层人群的“抱团取暖”行为[4]。厚泽民等提出了基于潜在语义索引的改进算法[5]。安计勇等提出了改进的K均值文本聚类算法[6]。
3 Web数据模型研究
3.1 Web数据特征分析
Web数据来源于互联网,具备发布随意、形式多样、表达自由等特点,使得特征分析结果冗余度高,离散效果明显,准确度差,难以科学把握其数据挖掘过程和结果分析。……