该研究探讨了循环变压器架构中是否仍能形成类似全局工作区的功能结构。此前研究在标准前馈变压器中发现了可言语化且具有因果效力的中间层表征带,而本研究通过雅可比透镜方法,将其扩展至循环架构,对两种循环模型(Ouro-2.6B和Huginn-0125)与标准非循环基线进行了系统比较。结果显示,循环架构中确实能形成工作区,但其访问方式发生改变:Ouro在每个循环中重建工作区内容,线性传输无法跨循环边界携带信息;Huginn则能跨全部循环传递内容,但读写和消融操作仅作用于约两个循环的滑动窗口内。研究还发现,新注入内容能否被言语化取决于逐迭代监督,而既有内容的可操控性则不受此影响。该工作为理解循环架构中的信息处理机制提供了新视角。
| Global Workspace | 全局工作区,一种认知架构概念,指信息在多个专门模块间共享和广播的机制,此处用于类比Transformer中的功能结构。 |
| Jacobian Lens | 雅可比透镜,一种分析方法,通过计算网络层的雅可比矩阵来揭示内部表征和因果结构。 |
| Looped Transformer | 循环Transformer,一种通过重复使用相同权重来增加深度而非堆叠不同层的架构。 |
| Virtual-Unrolling Adapter | 虚拟展开适配器,一种技术,用于将循环架构视为展开的层序列,以便应用标准分析工具。 |
| Causal Experiment | 因果实验,一种干预性测试,通过扰动模型内部状态来观察其对输出的影响,以推断因果关系。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅