本文重新审视了Breiman关于随机森林的核心观察,即在保持单棵决策树强度的前提下降低树间相关性可提升整体预测性能。作者据此提出两种新变体:Dirichlet-Multinomial Bagging随机森林(DM)和Dirichlet加权随机森林(DW),二者均通过浓度参数α对样本重加权进行调节。研究给出了一个简洁的理论判据,用以界定这两种变体与标准随机森林行为无差异的条件,并据此设计了轻量级调参策略。在公开分类基准上的对照实验表明,DM与DW方法表现稳定且具有竞争力,多数情况下优于其他随机森林基线,同时额外运行时间开销可忽略不计。该工作为通过重采样机制改进集成学习提供了理论依据与实用方案。
| Bootstrap Aggregating (Bagging) | 一种集成学习方法,通过对训练集进行有放回抽样生成多个子集,分别训练模型后聚合预测结果。 |
| Dirichlet Resampling | 使用Dirichlet分布生成样本权重或重采样概率的方法,通过浓度参数控制分布的集中程度。 |
| Random Forest (RF) | 由多棵决策树组成的集成模型,通过随机特征选择和Bagging降低方差,提高预测性能。 |
| Concentration Parameter α | Dirichlet分布中的参数,控制分布向均匀分布或稀疏分布的倾向,影响重加权的强度。 |
| Inter-tree Correlation | 随机森林中不同决策树之间预测结果的相关性,降低相关性通常能提升集成模型的泛化能力。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅