🔥 今日值得一读 菲尔兹奖得主搞大模型!4B手机+云端GLM刷爆ARC-AGI 3
菲尔兹奖得主入局大模型!4B手机Qwen+云端GLM刷爆ARC-AGI 3
量子位 🔥 重点 大模型多模态论文方法 🕐 09-07 16:36

📖 AI 总结

文章报道了Mostik团队的一项突破性研究:通过训练一个“桥”结构,让云端753B参数的GLM-5.2大模型与手机端4B参数的Qwen-3.5小模型直接传递内部隐藏状态,而非传统文本输出,从而大幅提升协作效率。该方法使小模型弥补了与753B大模型约50%的性能差距,准确率提升25%,在难题子集上提升达2倍,同时将大模型推理成本压缩至约二十分之一。团队由15人组成,含12名博士及菲尔兹奖得主Stanislav Smirnov,核心发现是模型间文本交流极其低效——大模型生成token时内部约两兆字节状态信息被丢弃,仅17比特文本被传递。该方案冻结双方权重,仅训练桥结构,未来或探索蒸馏等路径,为多模型高效协作提供了新思路。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅