田间病害诊断准确率飙到99.3%!AI多智能体融合模型,冲突证据也能秒判
Fusing Perceptual Vision Experts with Multimodal Large Language Models for Explainable Plant Disease Diagnosis: From Benchmark Imagery to Real-World Robotic Field Validation
arXiv CV (cs.CV) 重要 #多模态#Agent 🕐 08-27 12:00

📖 AI 总结

该研究提出了一种名为混合分层多智能体框架(H²MAF)的植物病害诊断方法,将EfficientNet-B3和ConvNeXt-Tiny两种视觉模型与开源多模态大语言模型(Gemma 4 E4B和Qwen3.5 4B)相结合,通过结构化JSON证据实现可解释的诊断输出,包括风险等级、治疗紧迫性和经济损失评估。研究在PlantDoc基准数据集(2,922张图像)和两个康奈尔大学机器人采集的田间数据集(共11,442张图像)上进行了验证。结果显示,在PlantDoc上,Gemma将准确率从63.9%提升至68.5%,在CNN冲突子集上提升达7.6个百分点;田间数据准确率高达99.3%和98.9%,模型间分歧仅为1.7-4.1%。值得注意的是,Gemma在关键风险错误上仅0.14-0.5个百分点,而Qwen存在3.5-14.4个百分点的过度标记问题。研究表明,多模态大语言模型仲裁为可解释农业AI提供了有前景但需校准的解决方案。

🔑 关键词速览

H$^{2}$MAF混合分层多智能体框架,结合CNN决策级融合与MLLM语义仲裁的病害诊断系统。
MLLM多模态大语言模型,能处理图像和文本,用于生成可解释的诊断和风险分析。
EfficientNet-B3一种高效的卷积神经网络架构,用于图像分类,平衡精度与计算效率。
ConvNeXt-Tiny一种基于Transformer思想的现代CNN变体,用于图像特征提取和分类。
决策级融合将多个模型的独立预测结果进行组合,以提升整体诊断准确性和鲁棒性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅