本文提出FedIncome,一个面向数字贷款场景的联邦学习收入估计框架,旨在解决借款人核实收入缺失、跨机构数据共享受限的问题。研究基于超100万条LendingClub贷款记录,按州划分为50个客户端,模拟异构贷款联盟。结果显示,最优联邦模型样本外R²达0.608,接近集中式池化基准的0.619;小样本客户端的样本外R²平均提升3.8个百分点,实证交叉点约为4790条训练观测。当数据无法集中时,联邦学习在各样本规模组均优于纯本地训练,对数据稀缺机构增益最大。将联邦收入估计与州及收入特定的债务收入比阈值结合后,模拟审批率上升而违约率变化有限。该研究表明,在数据本地化约束下,联邦学习能以较小的聚合性能损失实现协作建模,并显著优于本地独立训练。
| Federated Learning | 联邦学习,一种分布式机器学习范式,允许多个参与方在不共享原始数据的情况下协作训练共享模型。 |
| Income Estimation | 收入估计,指在缺乏验证收入信息时,利用模型预测借款人真实收入的过程。 |
| Data Sovereignty Constraints | 数据主权约束,指因法律、监管或机构政策限制,数据不能跨机构自由共享的约束条件。 |
| Out-of-time R² | 样本外决定系数,衡量模型在时间上未见过的数据上的预测拟合优度,值越接近1表示预测能力越强。 |
| Debt-to-Income Thresholds | 债务收入比阈值,用于评估借款人还款能力的指标,即债务与收入之比的上限标准。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅