17亿参数拆成5万记忆单元,语言模型准确率75%
Beyond the Parameter Monolith: Reconstructive Memories, Executable Skills, and Residual Assembly for Language Models
arXiv AI (cs.AI) 重要 #LLM架构#记忆机制#模块化 🕐 今天 12:00

📖 AI 总结

该论文探讨语言模型架构的一种新组织方式,主张将上下文计算、持久存储与精确执行从单一共享参数系统中分离出来。作者提出FEM-ASM框架,借鉴有限元方法,让独立构建的文档状态与确定性可执行技能向共享语言模型状态提交带类型的提案,并通过显式残差算子协调接口节点上的提案。实验采用受控测试与负面结果评估,而非宣称语言的物理有限元表述。原型系统包含52,809个重建记忆元素,预算约17亿浮点值,但重建不完整,token准确率约75%;支持感知的词法索引使这些元素可在溯源受控的查询下寻址。在可执行算术方面,位置化结果观测显著优于重复全局结果向量,输出替换会改变模型偏好答案。研究支持存储、执行与神经协调的分离,同时指出仅问题检索、无限制答案生成和端到端效率等未解局限。

🔑 关键词速览

FEM-ASM受有限元方法启发的组织架构,将文档状态和可执行技能作为类型化提案贡献给共享语言模型状态。
残差算子显式协调附加到公共接口节点上的提案的算子,用于整合不同来源的信息。
Multi-Mesh一种无注意力的原型模型,用于学习因果语言建模,但未达到有竞争力的通用能力。
重建性记忆元素存储在版本化存储中的记忆单元,用于重建信息,但重建准确率有限(约75%令牌准确率)。
支持感知词汇索引一种索引机制,使记忆元素在来源控制的查询构建下可寻址,支持精确检索。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅