该研究评估了ARIMA、随机森林和XGBoost三种模型在公共卫生预测中的表现,利用2020年1月至2023年10月安大略省190周COVID-19病例数据,采用滚动时间序列交叉验证确保时序完整性。研究从转折点响应速度、1至6周预测周期和训练数据量三个维度进行性能比较,并开发了MLAMA(机器学习与ARIMA模型平均法)——一种按预测周期和响应性动态调整权重的非负性能加权集成方法。结果显示,ARIMA在转折点后适应迅速但长周期误差增大;随机森林和XGBoost初始响应较慢但长周期误差更稳定;在研究末期两周预测中,使用近期数据训练优于长历史数据,尤其对XGBoost。MLAMA在多数预测周期中实现最低归一化平均绝对百分比误差,并在各响应性设置中名列前茅。研究建议根据运行条件选择预测模型而非依赖单一通用方法,MLAMA为整合统计与机器学习预测提供了实用框架。
| ARIMA | 自回归积分滑动平均模型,一种经典的时间序列统计预测方法,适用于捕捉线性趋势和季节性模式。 |
| XGBoost | 极端梯度提升,一种高效的机器学习算法,通过集成弱学习器提升预测精度,常用于非线性数据建模。 |
| MLAMA | 机器学习和ARIMA模型平均,一种非负性能加权集成方法,根据预测范围和响应性动态调整权重以优化预测。 |
| Rolling-origin time-series cross-validation | 滚动起点时间序列交叉验证,一种保持时间顺序的模型评估技术,模拟真实预测场景以测试模型稳定性。 |
| Normalized mean absolute percentage error | 归一化平均绝对百分比误差,一种衡量预测准确性的指标,通过归一化处理使不同尺度数据可比。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅