该研究针对FP4张量核心在加速矩阵乘法时,因缩放计算、操作数打包、布局构建及反向状态保存而抵消收益的问题,提出“格式感知融合”方法,将每个量化生产者与其缩放域和消费者布局协同设计,覆盖原生mxfp、全局nvfp及协作线程阵列局部nvfp三种格式。作者以Llama-3系列8B模型进行1600亿token预训练评测,在相同加速器对比中,bfloat16与Transformer Engine nvfp分别达到18.8K和27.6K tokens/s/GPU,而最快定制路径达37.9K;采用行梯度随机舍入与固定符号32值Hadamard权重梯度预处理的mxfp达到37.2K tokens/s/GPU,模型FLOP利用率为bfloat16的86.3%,训练损失终点仅高出2.11%。研究表明,FP4训练效果取决于缩放契约、操作数与执行路径的共同作用,且下游任务排名与训练损失排名并不一致。
| FP4 | 四比特浮点格式,一种超低精度数值表示,用于加速深度学习中的矩阵运算。 |
| 格式感知融合 | 一种协同设计方法,将量化生产者与其缩放域和消费者布局结合,以优化 FP4 计算效率。 |
| mxfp | 一种 FP4 变体,可能指微缩放浮点格式,用于在张量核心中实现高效计算。 |
| nvfp | 另一种 FP4 变体,可能指 NVIDIA 浮点格式,支持全局或局部缩放。 |
| Hadamard 权重梯度预条件 | 一种使用 Hadamard 变换对权重梯度进行预条件的技术,旨在改善 FP4 训练中的数值稳定性。 |
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅