该研究揭示了一种针对使用GELU或SiLU激活函数的平滑两层Transformer前馈网络(FFN)的新型模型提取攻击途径。在仅具备选择输入和原始输出访问权限的黑盒场景下,研究者利用投影输入Hessian矩阵中隐藏的对称秩一因子结构,构建了部分对称分解模型,实现了对内部FFN方向的高效恢复。实验表明,在CIFAR-10视觉Transformer上,仅需16个投影Hessian(对应8193次查询),即可达到平均余弦对齐度超过0.94的恢复效果,且在不同模型和层间保持稳定。恢复的结构还能支持功能提取,拟合剩余参数后,替代模型的top-1一致率超过93%,测试精度损失控制在0.9%以内。研究还发现,输出舍入和高斯噪声会降低攻击效果,但通过自适应调整有限差分步长可有效缓解。该工作首次证明了平滑FFN的曲率信息会暴露内部参数几何结构,对模型安全性和知识产权保护具有重要警示意义。
| Curvature Cryptanalysis | 利用模型输出对输入的曲率(如Hessian矩阵)进行密码分析,以提取内部结构的方法。 |
| Feed-Forward Networks (FFNs) | 前馈网络,是Transformer中逐位置应用的多层感知机,包含线性变换和激活函数。 |
| Chosen-Input Raw-Output Oracle | 一种黑盒访问模型,允许攻击者选择输入并获取模型的原始输出(非概率或标签)。 |
| Projected Input Hessians | 输入Hessian矩阵在特定方向上的投影,用于分析模型曲率的二阶信息。 |
| Partially Symmetric Decomposition | 将Hessian集合分解为对称秩一因子的部分对称形式,用于识别隐藏结构。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅