🔥 今日值得一读 世界时间计算:0.5B模型暴涨29分,代码世界模型让LLM泛化到未见领域!
World-Time Compute with Verified Code World Models
arXiv LG (cs.LG) 🔥 重点 #世界模型#代码生成#训练方法#泛化 🕐 09-10 12:00
👨‍💼 主理人解读 · 为什么值得关注
缺乏标注数据的领域,可用代码模板批量生成带标签轨迹来微调LLM,提升泛化。

📖 AI 总结

本文提出一种名为“世界-时间计算”的训练方法,旨在解决大语言模型在缺乏标注数据的领域中泛化能力不足的问题。其核心思路是:当某一领域的动态规律可用代码表达时,单个模板即可实例化为大量可执行、可验证的符号化世界模型,从而源源不断地生成精确标注的轨迹数据。研究者用这些轨迹微调大语言模型,发现其泛化能力可迁移至从未训练过的合成世界族。增益在能力最稀缺处最为显著:0.5B模型提升29个百分点,而最大模型的提升已落入噪声范围,呈现饱和趋势。由于世界由经过验证的代码生成,标签在20步展开中保持精确,对分布外探针的应答准确率达100%,而逐步预测的LLM与MLP则误差累积并崩溃。在ARC-AGI、List Functions、CLRS等真实基准上,该机制同样有效;List Functions的跨世界实验中,一个适配器在128个不相交世界上训练后,于留出世界达到40%,而标签损坏对照组仅6%。作者指出,该增益是一种饱和规律而非定律,在少步推理和小型弱模型上最大,在长链、感知类及已饱和任务上衰减,跨任务迁移在缺乏共享技能时较弱。研究范围限于符号状态,像素原生领域仍依赖学习型模型。

🔑 关键词速览

World-Time Compute训练时类比于测试时计算,通过在多个可验证代码世界模型上微调LLM来提升泛化能力。
World Models可执行、可验证的符号状态程序,能生成精确标注的轨迹,作为训练数据源。
Verified Code经过验证的代码,确保动态精确且标签可信,避免误差累积。
Domain Randomization一种通过随机化环境参数来增强泛化的技术,但本文方法强调每个世界独立编写和验证。
Test-Time Training在测试时对模型进行微调以适应特定任务,本文将其扩展到跨世界形式。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅