本研究基于UCI心脏病数据集,系统比较了传统机器学习模型与由GPT-4o和Claude Sonnet 4.6生成的大语言模型规则系统在心脏病预测中的表现。研究评估了逻辑回归、K近邻、支持向量机、朴素贝叶斯、决策树和随机森林等分类器,并以准确率、精确率、召回率和F1分数作为评价指标。结果显示,传统机器学习模型整体优于LLM生成的规则系统:随机森林表现最佳,准确率达90.2%,F1分数为0.906;朴素贝叶斯次之,准确率为88.5%。而Claude Sonnet 4.6生成的规则模型准确率为80.3%,GPT-4o仅为70.5%。尽管预测性能存在差距,LLM生成的IF-THEN规则提供了可解释的诊断逻辑,有助于提升临床决策的透明性。研究揭示了医疗人工智能中预测性能与可解释性之间的权衡关系。
| UCI Heart Disease Dataset | 加州大学欧文分校发布的心脏病数据集,常用于机器学习模型评估。 |
| LLM-Generated Rule-Based Systems | 利用大型语言模型自动生成IF-THEN规则来进行分类或预测的系统。 |
| Random Forest | 一种集成学习算法,通过构建多棵决策树并投票得出预测结果。 |
| F1-score | 精确率和召回率的调和平均数,综合衡量分类模型的性能。 |
| Interpretability | 模型决策过程对人类可理解的程度,在医疗AI中尤为重要。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅