文章报道了Mostik团队的一项突破性研究:通过训练一个“桥”结构,让云端753B参数的GLM-5.2大模型与手机端4B参数的Qwen-3.5小模型直接传递内部隐藏状态,而非传统文本输出,从而大幅提升协作效率。该方法使小模型弥补了与753B大模型约50%的性能差距,准确率提升25%,在难题子集上提升达2倍,同时将大模型推理成本压缩至约二十分之一。团队由15人组成,含12名博士及菲尔兹奖得主Stanislav Smirnov,核心发现是模型间文本交流极其低效——大模型生成token时内部约两兆字节状态信息被丢弃,仅17比特文本被传递。该方案冻结双方权重,仅训练桥结构,未来或探索蒸馏等路径,为多模型高效协作提供了新思路。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅