本文介绍了Safin-1,一个基于“内在安全”理念构建的基础模型家族,旨在将安全能力嵌入模型自身的原生计算中,而非依赖外部防护或事后对齐。其核心创新是MARCH网络架构,通过记忆锚定路由和状态演化机制,使模型能够维护结构化记忆状态,并基于内容条件路由选择性检索历史信息,从而支持测试时对持久能力状态的适应,无需反复修改主干网络。研究通过“安全状态”接口在下游安全任务中验证了该方法的有效性,显著提升了安全性。该路由状态接口统一了上下文记忆与持久能力适应,将记忆从被动记录转变为主动塑造模型行为的基质。评估涵盖通用能力、长上下文理解、检索和效率等多个维度,结果表明Safin-1表现优异。这项工作为安全作为可自适应维护的状态原生能力提供了新路径,但作者也指出,这仅是初步架构探索,实现更广泛愿景仍需大量后续研究。
| Safety from Within | 一种安全性设计理念,强调安全能力内置于模型自身计算中,而非依赖外部约束。 |
| Memory-Anchor Routing across Context History (MARCH) | 一种网络架构,通过内容条件路由维护结构化记忆并检索历史信息。 |
| State Evolution | 模型内部状态随时间演化的机制,用于适应任务需求。 |
| Safety State | 一种可调整的模型状态,用于在测试时提升安全性能。 |
| Test-time Adaptation | 在推理阶段调整模型行为,无需重新训练或修改主干网络。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅