4B记忆直接传给9B,不重读上下文,损失直降0.747!
LatentPort: Beyond KV Cache - Cross-Model Transfer of Recurrent Memory in Hybrid Language Models: A 4B-to-9B Hybrid-State Handoff Without Target Prefix Replay
arXiv CL (cs.CL) 重要 论文方法大模型记忆 🕐 今天 12:00

📖 AI 总结

该论文提出LatentPort方法,探索能否让一个语言模型将实时记忆直接移交给另一个模型,而接收方无需重新读取上下文。作者在一对架构匹配的Qwen3.5 4B与9B混合模型间实现了持久混合状态的跨模型传递,据称这是首个在规模不同的混合语言模型之间、无需目标前缀重放即可完成持久循环推理状态移交的演示。仅迁移注意力KV存在较大差距,加入Gated DeltaNet持久状态包后,教师强制负对数似然平均降低0.747 nats/token,64篇PG19文档全部改善;直接复用循环与卷积状态优于所测试的学习式GDN映射。经43万余参数校正后,在64篇新网页文档上,续写损失仅比原生9B高0.076 nats/token,JS散度为0.022,原生上下文恢复率达0.918,且处理零历史前缀token时显著优于继续运行的4B。研究同时指出,证据仅覆盖单一方向、单一几何匹配的Base模型对及4K教师强制续写,近原生门槛未通过,16K分支未运行,自由生成等价性与通用状态接口仍待验证。

🔑 关键词速览

KV Cache键值缓存,Transformer 注意力机制中存储历史键值对以加速自回归生成的缓存。
Gated DeltaNet (GDN)门控 DeltaNet,一种具有门控机制的循环状态更新网络,用于维护持久记忆状态。
Negative Log-Likelihood (NLL)负对数似然,衡量模型预测下一词元不确定性的损失指标,值越低表示预测越准确。
Jensen-Shannon (JS) DivergenceJensen-Shannon 散度,一种对称的概率分布差异度量,用于比较两个模型输出分布的相似性。
Native Context Recovery (NCR)原生上下文恢复,衡量迁移后模型恢复目标模型原生上下文处理能力的指标。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅