该研究构建了一个结合共识特征选择、混合重采样、堆叠集成与可解释人工智能的破产预测框架,以应对严重不平衡金融数据中少数类样本检测难题。基于台湾破产预测数据集,研究先通过五种特征选择算法共识规则将输入变量缩减至23个,再采用SVM-SMOTE、SMOTE-Tomek和SMOTE-ENN三种重采样方法平衡训练数据,并比较五种集成学习模型与五种深度学习模型的性能。结果显示,重采样策略显著影响模型表现:SVM-SMOTE和SMOTE-Tomek偏向准确率与特异性,而SMOTE-ENN更利于少数类识别。独立模型中,GRU结合SMOTE-ENN取得最佳平衡,召回率达0.8627,G-mean为0.8517,ROC-AUC为0.9431;堆叠集成中,SMOTE-ENN配合梯度提升类基学习器与LSTM元学习器表现最优。SHAP分析揭示杠杆、盈利能力、偿债能力和运营效率是预测破产风险的关键指标,为财务困境企业提供了更可靠且可解释的早期预警工具。
| Hybrid Resampling | 混合重采样,结合过采样和欠采样技术以平衡不平衡数据集的方法。 |
| Stacking Ensemble | 堆叠集成,一种集成学习方法,通过元学习器组合多个基学习器的预测结果。 |
| XAI (Explainable Artificial Intelligence) | 可解释人工智能,旨在使AI模型决策过程透明化、可理解的技术。 |
| SMOTE-ENN | 一种混合重采样技术,结合SMOTE过采样和编辑最近邻欠采样,以清理噪声样本。 |
| SHAP | SHapley Additive exPlanations,一种基于博弈论的特征重要性解释方法。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅