《环境与职业医学杂志》发表论文赏析
作者:莫有桦, 张鹏, 谷一硕, 朱晓俊, 樊晶光,
摘要:背景轻量级梯度提升机算法(LightGBM)以其高效、快速等特点成为预测模型中的热门选择。然而,由于机器学习模型存在“黑盒”特性,导致模型可解释性较差。目前很少有研究从LightGBM模型及模型可解释性的角度评估职业伤害的严重程度。目的评估LightGBM模型及模型可解释性方法在职业伤害预测中的应用价值。方法应用美国矿山安全与健康管理局(MSHA)1983—2022年采矿业工人职业伤害数据集,以伤害程度(死亡/致命性职业伤害和永久/部分残疾)作为结局变量,以伤害发生的月份、年龄、性别、事故发生时间、轮班开始时间、事故发生时间与轮班开始时间间隔、总工龄、矿山总工龄、现矿山工龄、职业伤害致因、事故类型、伤害发生活动(即伤害发生时工人正在进行的活动)、伤害来源、受伤部位、作业环境类型、产品类别、伤害性质共17个指标作为预测变量。通过最小绝对收缩与选择算子算法(Lasso)回归方法筛选特征集。应用LightGBM构建职业伤害预测模型,以预测模型的曲线下面积(AUC)为主要评价指标,AUC越接近1,说明模型预测性能越好。应用Shapley 加法解释(SHAP)法对模型可解释性进行评价。结果通过Lasso回归,识别出关键影响因素7个,分别为事故发生时间与轮班开始时间间隔、现矿山工龄、职业伤害致因、事故类型、受伤部位、伤害性质、作业环境类型。基于Lasso回归特征筛选构建的LightGBM模型预测性能良好,其AUC值、准确度、特异度、灵敏度分别为0.9941(95%CI:0.9917~0.9966)、0.9743、0.9781、0.9640,预测的致死性职业伤害概率与实际的致死性职业伤害概率一致性较高。在职业伤害预测模型中,通过SHAP值分析各指标的重要性,发现受伤部位和伤害性质是影响模型预测结果的两个主要特征,其他特征的影响较小。受伤部位的SHAP值分布广泛,尤其是头颈部和多部位的受伤,对预测致死性风险的模型有显著影响。伤害性质也对模型有不同方向的影响,窒息/溺水、挤压和多部位受伤对工人发生致死性职业伤害风险影响较大。结论LightGBM模型能够高效地处理大规模数据并提供高精度的预测结果。模型可解释性研究有助于更准确地探索、分析采矿业工人发生致死性职业伤害的各种风险关键因素,并进一步揭示这些因素间的复杂交互作用,从而为劳动工人提供更好的预防干预保护措施和最佳的资源配置。
关键词:职业伤害, 轻量级梯度提升机算法, 预测模型, 模型可解释性, Shapley加法解释,