9B模型实时解说MOBA,事件召回率从34.5飙到42.1!
MOBA-VL: Event-Localized Multi-Turn Reinforcement Learning for Real-Time MOBA Commentary
arXiv CV (cs.CV) 重要 #VLM#强化学习#实时解说 🕐 今天 12:00

📖 AI 总结

本文提出MOBA-VL,一个面向多人在线战术竞技(MOBA)电竞赛事实时解说的视觉语言模型。针对现有流式模型解说流畅但常遗漏击杀、目标等关键事件的问题,作者利用记录事件发生时刻的游戏遥测数据作为监督信号,采用事件定位的多轮强化学习,对描述具体事件的对话轮次给予奖励。研究还构建了MOBACast数据集,涵盖三款MOBA游戏、860场职业比赛(约460小时)及词级时间戳解说,并建立MOBACast-Bench基准。实验显示,MOBA-VL在完整比赛和片段解说上的综合得分均优于StreamingVLM和DeepSeek-V4.1-Flash,事件定位奖励机制将事件召回率从34.5提升至42.1。该工作为实时赛事解说中的事件感知与准确性提供了新思路。

🔑 关键词速览

MOBA-VL本文提出的90亿参数视觉语言模型,用于MOBA电竞实时解说,采用事件定位的多轮强化学习训练。
事件定位的多轮强化学习一种强化学习方法,利用游戏遥测数据精确标记事件发生的时间,并对描述这些事件的对话轮次给予奖励。
MOBACast本文收集的数据集,包含三个MOBA游戏的860场职业比赛(约460小时),带有词级时间戳的解说。
MOBACast-Bench基于留出锦标赛构建的基准测试,用于评估MOBA实时解说模型的性能。
流式VLM能够处理连续视频流并实时生成文本的视觉语言模型,但可能遗漏关键事件。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅