全球约10亿人存在视力障碍,但现有视觉语言模型生成的描述过于笼统,难以支撑盲人与低视力用户的安全导航:大型模型虽能生成高质量音频描述,却无法在移动设备上运行;小型模型延迟表现尚可,却缺乏空间细节、方向线索和危险感知能力。针对这一矛盾,研究提出Smol-VL-BLV,一个基于5亿参数解码器Transformer的紧凑型视觉语言模型,通过教师—学生蒸馏与带复合奖励的组相对策略优化两阶段后训练,强化方向性语言、度量距离和危险检测能力,并额外加入轻量微调以缓解多阶段训练导致的灾难性遗忘。实验显示,该模型在空间评分上相对基线提升19.3%,社交评分提升14.8%,OCR-Bench提升101.5%,TextVQA准确率提升44.2%。经混合精度量化后模型约450MB,可在中端安卓手机完全离线运行,为低视力辅助提供了兼顾性能与可部署性的方案。
| VLM (Vision-Language Model) | 视觉语言模型,一种能同时处理图像和文本并生成描述或回答问题的AI模型。 |
| BLV (Blind and Low-Vision) | 盲人和低视力人群,指视力严重受损、需要辅助技术进行导航和获取信息的用户群体。 |
| GRPO (Group Relative Policy Optimization) | 组相对策略优化,一种强化学习微调方法,通过比较一组生成样本的相对质量来优化模型策略。 |
| Catastrophic Forgetting | 灾难性遗忘,指模型在学习新任务时丢失先前已掌握知识或能力的现象。 |
| Mixed-Precision Quantization | 混合精度量化,一种模型压缩技术,使用不同数值精度表示权重和激活值,以减小模型体积并加速推理。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅