🔥 今日值得一读 FP4预训练飙至37.9K tokens/s/GPU,比bf16快2倍!
Format-Aware Fusion for Fast FP4 Pretraining
arXiv LG (cs.LG) 🔥 重点 #FP4量化#预训练#训练加速 🕐 今天 12:00
👨‍💼 主理人解读 · 为什么值得关注
可显著加速FP4低精度大模型预训练,减少量化开销与显存占用。

📖 AI 总结

该研究针对FP4张量核心在加速矩阵乘法时,因缩放计算、操作数打包、布局构建及反向状态保存而抵消收益的问题,提出“格式感知融合”方法,将每个量化生产者与其缩放域和消费者布局协同设计,覆盖原生mxfp、全局nvfp及协作线程阵列局部nvfp三种格式。作者以Llama-3系列8B模型进行1600亿token预训练评测,在相同加速器对比中,bfloat16与Transformer Engine nvfp分别达到18.8K和27.6K tokens/s/GPU,而最快定制路径达37.9K;采用行梯度随机舍入与固定符号32值Hadamard权重梯度预处理的mxfp达到37.2K tokens/s/GPU,模型FLOP利用率为bfloat16的86.3%,训练损失终点仅高出2.11%。研究表明,FP4训练效果取决于缩放契约、操作数与执行路径的共同作用,且下游任务排名与训练损失排名并不一致。

🔑 关键词速览

FP4四比特浮点格式,一种超低精度数值表示,用于加速深度学习中的矩阵运算。
格式感知融合一种协同设计方法,将量化生产者与其缩放域和消费者布局结合,以优化 FP4 计算效率。
mxfp一种 FP4 变体,可能指微缩放浮点格式,用于在张量核心中实现高效计算。
nvfp另一种 FP4 变体,可能指 NVIDIA 浮点格式,支持全局或局部缩放。
Hadamard 权重梯度预条件一种使用 Hadamard 变换对权重梯度进行预条件的技术,旨在改善 FP4 训练中的数值稳定性。
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅