这篇论文探讨了一个核心问题:AI智能体在硬件设计中取得的成功,究竟源于对计算机架构的真正理解,还是仅仅在无意义的参数空间中进行盲目搜索。作者提出AutoTuring实验框架,将同一智能体置于相同的15维加速器设计空间中两次:一次以具名的架构参数和模拟器计数器呈现,另一次以[0,1]区间上的匿名变量呈现,而评估器、合法空间和可达最优解完全一致,唯一变量是问题是否具有语义。在九内核FP16 GEMM测试集上,具名条件下的智能体比建模的H200快5.4%,比匿名条件下的自身高出12.3%,且模拟器调用次数减少70.1%。但进一步实验发现,引入批评循环后,匿名智能体可追回大部分差距,而具名智能体并无额外收益,说明架构知识与结构化批评之间存在替代关系而非互补关系。作者将这一对比方法本身视为主要贡献,并指出结果为初步发现。
| AutoTuring | 本文提出的实验框架,通过对比同一智能体在命名架构旋钮与匿名变量下的表现,测量其对计算机体系结构的理解程度。 |
| FP16 GEMM | 半精度浮点通用矩阵乘法,是深度学习与高性能计算中的核心运算,常作为硬件加速器性能评测的基准。 |
| H200 | 英伟达(NVIDIA)推出的高性能GPU加速器,本文中作为建模的参考硬件基线。 |
| Critic Loop | 一种让智能体通过自我批评或外部反馈迭代改进设计方案的机制,本文中用于对比其与架构知识的作用。 |
| Architectural Knobs | 指加速器设计中可调节的架构参数(如缓存大小、流水线深度等),本文中作为有语义的命名变量。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅