引入SAEScientist-Bench,评估AI智能体能否自主进行SAE可解释性研究。
| Sparse Autoencoders (SAEs) | 稀疏自编码器,一种通过稀疏约束学习可解释特征表示的神经网络模型,用于机械可解释性研究。 |
| Mechanistic interpretability | 机械可解释性,旨在通过逆向工程理解模型内部计算机制的研究领域。 |
| Recursive self-improvement (RSI) | 递归自我改进,指AI系统自主改进自身能力的过程,通常涉及自动化训练和优化。 |
| Contrastive probes | 对比探针,用于通过对比不同文本或概念来测试模型内部特征响应的实验工具。 |
| Causal steering | 因果引导,通过干预模型内部表示来影响生成输出的技术,用于验证特征的功能作用。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅