Meta 团队发布 FBTriton,用 Triton 重新实现了推荐系统中表批嵌入(TBE)的前向与反向核心算子,用于支撑数千张分片 GPU 上的嵌入查找。实现上,通用 gather 路径按 bag 分程序、循环遍历特征表,并支持 int32 索引以减半存储与排序键宽,FP16/BF16 权重以 FP32 累加、FP32 权重以 FP64 累加以保证大维度精度;针对小表场景另设直方图与张量核专用路径,用 tl.dot 加速计数乘表运算。性能方面,在 B200 上边界检查环节最高取得 1.24 倍加速,整体 Triton 实现优于原有 CUDA 内核。该工作表明 Triton 已能胜任推荐系统大规模嵌入查找这类关键负载,并为后续优化留出空间。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅