Google调Pallas内核:别信模型,盯紧寄存器!
Pallas 内核怎么调优?Google 给出的答案是“少信模型,多看寄存器”
InfoQ 中文 重要 算力论文方法 🕐 今天 22:22

📖 AI 总结

Google 为开源 TPU 性能分析器 XProf 新增了内核级性能分析套件,使开发者能够查看 Pallas、Mosaic 等自定义内核的周期级执行细节,而不再将其视为不透明块。文章指出,这类自定义内核会跳过标准 XLA Pass,导致编译期静态成本模型失真,FLOPs 等效率指标可能严重偏差,甚至将实际等待 HBM 的 MXU 误判为充分利用。该套件通过编译器标志追踪、LLO 指令级轨道展示和运行时硬件计数器采样三个层级工作,并支持亚微秒级外部触发采样。在一个分块矩阵乘法案例中,开发者借助计数器发现内存停顿瓶颈,通过三重缓冲将执行时间从 125.5µs 降至 88µs,降幅约 30%。文章据此提出指标信任层级:硬件寄存器读数应作为优化依据,而 XLA 成本模型估算需谨慎对待。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅