🔥 今日值得一读 普林斯顿新RLT:每词元跑96块,状态跨词元不重置,深度无上限!
A Princeton Researcher Proposes Recurrent Looped Transformer (RLT) that Carries Decoder State across Every Token, Fixing 96 Blocks per Token with Unbounded Temporal Depth
MarkTechPost 🔥 重点 论文方法大模型算力 🕐 09-14 01:02

📖 AI 总结

普林斯顿研究者Yifan Zhang发布技术报告,提出循环环状Transformer(RLT)架构,旨在解决主流解码器-only大语言模型中相邻token之间信息不流通的问题。在现有架构中,最后一个解码层的计算结果无法传递给下一个token的首层,位置间仅通过缓存的键值注意力进行通信。RLT通过将解码器的最终隐藏状态及逐层滑动窗口注意力缓存跨token传递,在提示和响应之间不设重置边界,从而闭合这一循环。该架构将因果编码器与循环解码器配对,参考配置使用48层编码器和48层解码器并共享权重,每个token执行96个逻辑块。报告明确定位为设计规范,阐述了架构、执行调度和强化学习重放契约,但未提供效率、推理质量或扩展性方面的实测结果。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅