使用测试数据生成模型
学习目标
评估数据集中的哪些功能对模型的预测影响最大。
此部分显示训练模型在测试数据集的 1000 行的子集上生成的预测结果。预测基于模型的学习模式,并包括有助于评估其可靠性的关键指标。
第 1 步:选择数据的子集
在删除 'FLIGHT_RISK' 列后,从测试数据集中选择 1000 名员工的子集,以确保无偏见预测。
hdf_new=df_test.drop('FLIGHT_RISK').head(1000)
display(hdf_new.collect())
ITEM_NUMBER |
EMPLOYEE_ID |
年龄 |
AGE_GROUP10 |
AGE_GROUPS |
生成 |
CRITICAL_JOB_ROLE |
RISK_OF_LOSS |
IMPACT_OF_LOSS |
FUTURE_LEADER |
生成者... |
CURRENT_REGION |
CURRENT_COUNTRY |
CURCOUNTRYLAT |
CURCOUNTRYLON |
PROMOTION_WITHIN_LAST_3_YEARS |
CHANGED_POSITION_WITHIN_LAST_2_YEARS |
CHANGE_IN_PERFORMANCE_RATING |
FUNCTIONALAREACHANGETYPE |
JOBLEVELCHANGETYPE |
标题 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
0 |
10037 |
33 |
(25-35] |
(30-35] |
Y 世代 |
非关键 |
低 |
低 |
无未来领导人 |
男性 ... |
美洲 |
墨西哥 |
19.432601 |
-99.133342 |
无促销 |
无更改 |
0 - 不可用 |
无更改 |
无更改 |
1 |
1 |
10045 |
33 |
(25-35) |
(30-35) |
Y 世代 |
关键 |
中 |
中 |
无未来领导人 |
女性 ... |
美洲 |
美国 |
39.783730 |
-100.445882 |
无促销 |
无更改 |
0 - 不可用 |
无更改 |
无更改 |
1 |
2 |
10082 |
33 |
(25-35) |
(30-35) |
Y 世代 |
关键 |
低 |
中 |
无未来领导人 |
男性 |
美洲 |
美国 |
39.783730 |
-100.445882 |
无促销 |
无更改 |
0 - 不可用 |
无更改 |
无更改 |
1 |
3 |
10086 |
33 |
(25-35] |
(30-35] |
Y 世代 |
非关键 |
中 |
低 |
未来领导人 |
男性 ... |
美洲 |
美国 |
39.783730 |
-100.445882 |
无促销 |
无更改 |
0 - 不可用 |
无更改 |
无更改 |
1 |
4 |
10092 |
33 |
(25-35) |
(30-35) |
Y 世代 |
非关键 |
低 |
低 |
未来领导人 |
男性 ... |
美洲 |
美国 |
39.783730 |
-100.445882 |
无促销 |
无更改 |
0 - 不可用 |
无更改 |
无更改 |
1 |
. ... |
... |
... |
... |
... |
... |
... |
... |
... |
... |
... |
... |
... |
... |
... |
... |
... |
... |
... |
... |
|
995 |
16699 |
36 |
(35-45) |
(35-40) |
Y 世代 |
关键 |
中 |
低 |
无未来领导人 |
男性 ... |
EMEA |
爱尔兰 |
52.865196 |
-7.979460 |
促销 |
无更改 |
3 - 减少 |
跨职能移动 |
促销 |
1 |
996 |
16702 |
36 |
(35-45) |
(35-40) |
Y 世代 |
关键 |
高 |
中 |
无未来领导人 |
女性 ... |
EMEA |
丹麦 |
55.670249 |
10.333328 |
无促销 |
变更 |
1 - 增加 |
跨职能移动 |
相同级别 |
1 |
997 |
16704 |
36 |
(35-45] |
(35-40] |
Y 世代 |
非关键 |
中 |
高 |
未来领导人 |
男性 ... |
APJ |
中国 |
35.000074 |
104.999927 |
无促销 |
无更改 |
3 - 减少 |
跨职能移动 |
相同级别 |
1 |
998 |
16710 |
45 |
(45-55) |
(40-45) |
X 世代 |
关键 |
中 |
中 |
无未来领导人 |
男性 ... |
EMEA |
意大利 |
42.638426 |
12.674297 |
促销 |
变更 |
1 - 增加 |
跨职能移动 |
促销 |
1 |
999 |
16731 |
50 |
(45-55] |
(45-50] |
X 世代 |
关键 |
高 |
高 |
无未来领导人 |
男性 ... |
美洲 |
美国 |
39.783730 |
-100.445882 |
无促销 |
变更 |
2 - 常量 |
跨职能移动 |
相同级别 |
1 |
1000 行 × 40 列
步骤 2:运行预测
使用经过训练的模型生成预测:
predicted_classification = hgbc.predict(hdf_new, key = 'EMPLOYEE_ID', attribution_method='tree-shap',
missing_replacement='feature_marginalized')
步骤 3:过滤和显示结果
请注意,下表中显示了一些预测示例。该表包括以下列:'EMPLOYEE_ID'、'SCORE'、'CONFIDENCE'、'REASON_CODE'、'Top 1' 和 'PCT 1'。
"SCORE"[1] 列表示预测类别值,而"CONFIDENCE"列表示模型进行的分类预测的概率或置信水平。
此外,"REASON_CODE"列提供对与预测分类(即本地功能重要性或可解释性)[2] 相关的功能重要性的分析。
例如,表中的行号"零"表示分类为"是"(表示员工流失)的员工记录。此分类最具影响力的功能是 'FUNCTIONALAREACHANGETYPE'("前 1"列中列出),百分比值为 29%(显示在"PCT 1"列中)。
pd.set_option('max_colwidth', None)
display(predicted_classification.filter('"SCORE" = \'Yes\'').select(
'EMPLOYEE_ID', 'SCORE', 'CONFIDENCE', 'REASON_CODE',
('json_query("REASON_CODE", \'$[0].attr\')', 'TOP 1'),
('json_query("REASON_CODE", \'$[0].pct\')', 'PCT 1') ).head(3).collect())
ITEM_NUMBER |
EMPLOYEE_ID |
分数 |
信心 |
REASON_CODE |
第一名 |
PCT 1 |
|---|---|---|---|---|---|---|
0 |
10772 |
是 |
0.9805 |
代码片段复制代码 |
"FUNCTIONALAREACHANGETYPE" |
29.6167 |
1 |
12996 |
是 |
0.6626 |
代码片段复制代码 |
"FUNCTIONALAREACHANGETYPE" |
26.1833 |
2 |
16484 |
是 |
0.5256 |
代码片段复制代码 |
"FUNCTIONALAREACHANGETYPE" |
36.9316 |
ITEM_NUMBER |
EMPLOYEE_ID |
分数 |
信心 |
REASON_CODE |
第一名 |
PCT 1 |
|---|---|---|---|---|---|---|
0 |
27221 |
是 |
0.522728 |
代码片段复制代码 |
"TIMEINPREVPOSITIONMONTH" |
34.21097120019775 |
1 |
27858 |
是 |
0.990345 |
代码片段复制代码 |
"TIMEINPREVPOSITIONMONTH" |
41.194646979837177 |
2 |
28272 |
是 |
0.703382 |
代码片段复制代码 |
"TIMEINPREVPOSITIONMONTH" |
30.169212529463996 |
以上行显示输出(预计离职员工的过滤结果)。
汇总结果
输出表包括以下键列:
'EMPLOYEE_ID':每个员工的唯一标识符。
'SCORE':该模型的预测指示员工是否可能离开("是"表示流失,否则为"否")。
"置信度":预测中的确定性度量,表示模型将输入数据与预测结果关联的程度。
"SCORE" 越高表示流失的可能性越大,而 "CONFIDENCE" 值越高表明预测越可靠。
这些洞察可用于改进有针对性的员工保留策略,利用由数据驱动的分析降低员工流失率。
参考
[1]统一分类
结论
模型评估期间获取的 AUC 性能指标值高于 '0.90',这表示分类器表现良好。
通过查看模型训练结果,我们显示了功能重要性部分。即,解释并有助于模型的全局分类性能的所有属性的相对重要性。
在模型预测部分期间,我们突出显示了较高的 'CONFIDENCE' 值,表示模型预测中的可靠性更高。此外,我们还通过提供用于了解预测建模 [1] 的有效工具展示了"可解释性"的相关性(例如,'REASON_CODE' 列中提供的输出)。
我们展示了 SAP HANA PAL 如何将"可解释性"无缝集成到分类中,它还扩展到各种回归算法和时间序列分析。机器学习可解释性是实现 SAP 的合乎道德的 AI 目标,确保 AI 系统中的公平性、透明度和可信度不可或缺的一部分。
总之,可以利用这些洞察,基于模型驱动的分析主动实施员工保留战略。