黑盒攻击Transformer FFN:仅8193次查询恢复隐藏结构,对齐度超0.94!
Curvature Cryptanalysis of Smooth Transformer Feed-Forward Networks
arXiv LG (cs.LG) 重要 #模型安全#Transformer#隐私 🕐 09-01 12:00

📖 AI 总结

该研究揭示了一种针对使用GELU或SiLU激活函数的平滑两层Transformer前馈网络(FFN)的新型模型提取攻击途径。在仅具备选择输入和原始输出访问权限的黑盒场景下,研究者利用投影输入Hessian矩阵中隐藏的对称秩一因子结构,构建了部分对称分解模型,实现了对内部FFN方向的高效恢复。实验表明,在CIFAR-10视觉Transformer上,仅需16个投影Hessian(对应8193次查询),即可达到平均余弦对齐度超过0.94的恢复效果,且在不同模型和层间保持稳定。恢复的结构还能支持功能提取,拟合剩余参数后,替代模型的top-1一致率超过93%,测试精度损失控制在0.9%以内。研究还发现,输出舍入和高斯噪声会降低攻击效果,但通过自适应调整有限差分步长可有效缓解。该工作首次证明了平滑FFN的曲率信息会暴露内部参数几何结构,对模型安全性和知识产权保护具有重要警示意义。

🔑 关键词速览

Curvature Cryptanalysis利用模型输出对输入的曲率(如Hessian矩阵)进行密码分析,以提取内部结构的方法。
Feed-Forward Networks (FFNs)前馈网络,是Transformer中逐位置应用的多层感知机,包含线性变换和激活函数。
Chosen-Input Raw-Output Oracle一种黑盒访问模型,允许攻击者选择输入并获取模型的原始输出(非概率或标签)。
Projected Input Hessians输入Hessian矩阵在特定方向上的投影,用于分析模型曲率的二阶信息。
Partially Symmetric Decomposition将Hessian集合分解为对称秩一因子的部分对称形式,用于识别隐藏结构。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅