(上海大学 悉尼工商学院,上海 200444)
随着现代科技的不断发展,企业所处的环境在不断变化,企业本身也在不断变化。在现代竞争激烈的社会中,职工离职的现象越来越普遍。很多企业认为员工流失所造成的成本只包括离职成本和招聘成本,却忽视了职工离职引起的其他流动成本,比如重要客户的流失、商业机密的泄露、企业竞争力的下降等。在如此情况下,公司的人力资源部门应该如何减少职工的离职倾向,从而降低公司经营成本是极其具有现实意义的[1]。
国内外学者对于职工的离职现象开展了大量的研究工作[2-4],主要包括三大方向,即职工离职因素研究、降低职工离职率的措施研究和职工离职的预测研究。目前与本文研究方向类似的,即关于职工离职预测的研究,主要是基于机器学习的方法,着眼于模型算法的比较和探讨,忽视了对数据处理的研究。然而,目前一些比较成熟的机器学习模型算法,都对被处理的数据集合有一定要求,比如较好的完整性、较少的冗余性等。但现实海量数据中无意义的成分居多,严重影响了模型的性能和效果。因此,本文的重难点在于如何对原始数据提取并挖掘有效特征,突出数据预处理技巧对职工离职预测模型性能的影响,以弥补现有研究中对数据处理部分的忽视。
本文数据来自于IBM Watson Analytics 分析平台分享的数据,共1 470 条记录,35 个字段信息。原始数据集描述的是影响员工流失的因素,对字段信息的详细说明如表1所示。……