基于K-means聚类算法的学生表现数据分析及预测建模研究

2021-06-04 03:15:32吕丁
微型电脑应用 2021年5期
关键词:学生

吕丁

(陕西警官职业学院 治安系, 陕西 西安 710021)

0 引言

本文通过对不同校园管理系统数据进行预处理,去除重复、缺失的脏数据,并基于传统K-means算法建立学生表现行为的预测模型,对学生表现行为分类,通过针对不同类型学生特征,实现对学生校园表现的针对性管理。

1 K-means的数据预处理

1.1 数据挖掘

数据挖掘在以海量数据分析的基础上,提取满足不同业务目标数据信息的过程,并将信息反馈给用户。为获得满足用户需求的潜在有效信息,就要求对表层信息进行充分挖掘,去除冗余数据,并将关键数据能可视化的展示到用户面前。预测和描述作为数据挖掘的两个目标,预测指的是利用数据库中某些信息字段和变量预测隐含的有用信息,描述指将数据描述成可理解模式[1-3]。

本文采用ETL工具来获得校园一卡通系统、学生管理系统、图书馆系统和教务系统的数据信息,在对各数据管理系统的基础上,选择“学号、贫困生等级、奖学金等级、德育成绩、体育成绩、智育成绩、竞赛等级”7个属性作为特征评价指标[4-6]。

1.2 数据的清理

数据的清理主要包括格式的标准化、异常数据和重复数据的清除和错误数据纠正。通过查询某一高校成绩管理系统,就能获得近40余万条信息,整个数据量极为庞大,因此有必要对一部分重复数据进行清除,并从其他系统中获取其他维度的数据来补充整个数据库。如成绩系统中包括了学生各科目成绩信息,而学生的奖学金、竞赛信息均处于空缺,同时部分学生的某些成绩表存在很多空缺数据,这主要是由于学生缺考、补考或一些未知原因造成。……

登录APP查看全文

猜你喜欢
学生
快把我哥带走
亲爱的学生们,你们并没有被夺走什么
英语文摘(2020年9期)2020-11-26 08:10:12
如何唤醒学生自信心
甘肃教育(2020年6期)2020-09-11 07:45:16
怎样培养学生的自信
甘肃教育(2020年22期)2020-04-13 08:10:54
如何加强学生的养成教育
甘肃教育(2020年20期)2020-04-13 08:04:42
“学生提案”
当代陕西(2019年5期)2019-11-17 04:27:32
《李学生》定档8月28日
电影(2018年9期)2018-11-14 06:57:21
赶不走的学生
学生写话
学生写的话