苹果幼果识别F1达0.93!轻量级框架边缘部署仅127MB,毫秒级推理
A Lightweight Multimodal Vision-Language Framework for Early-Stage Anatomical Green Fruit Classification in Commercial Orchards
arXiv CV (cs.CV) #多模态#视觉 🕐 08-27 12:00

📖 AI 总结

该研究提出了一种轻量级多模态视觉-语言框架,用于商业果园中早期苹果幼果的精细解剖结构分类,包括花萼、果体和果柄。研究基于从Scilate和Scifresh苹果园采集的600张高分辨率RGB图像,将其转换为224×224图像块并标注三类解剖结构。通过领域特定的语言提示引导多模态对齐,并采用滑动窗口推理策略生成空间热图,实现全图像的可解释定位。在NVIDIA T4 GPU上,模型对花萼、果体和果柄的F1分数分别达到0.95、0.98和0.85,宏F1为0.93。部署优化采用ONNX和TensorRT,在NVIDIA Jetson硬件上实现毫秒级推理,模型大小约127-137 MB,INT8量化下精度保持稳定。结果表明,轻量级视觉-语言模型可为自动化幼果分析和未来机器人疏果系统提供可解释且边缘可部署的感知能力,源代码已公开。

🔑 关键词速览

TinyCLIP一种轻量级的视觉-语言预训练模型,用于多模态对齐和分类任务。
多模态视觉-语言框架结合图像和文本提示进行联合学习的模型架构,用于提升分类性能。
滑动窗口推理通过固定步长在图像上滑动窗口,逐块预测并聚合结果以生成空间热图的技术。
INT8量化将模型参数从浮点数转换为8位整数,以减少模型大小和加速推理,同时保持精度。
边缘部署在资源受限的边缘设备(如NVIDIA Jetson)上运行模型,实现实时推理。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅