生成式推荐系统将个性化推荐重构为对用户行为的序列建模,把交互、上下文、候选物品和动作视为高基数事件流中的token,由模型生成或评分下一个相关物品。NVIDIA在其recsys-examples仓库中提供了基于Dynamo-Triton的端到端HSTU推理工作流,整合了PyTorch AOTI编译、FlexKV键值缓存、原生C++验证和NV嵌入缓存等组件。其中AOTI将HSTU排序模型编译为原生C++产物,FlexKV缓存则存储可复用的注意力状态,避免对长用户历史重复计算。在NVIDIA RTX PRO 6000 Blackwell工作站版GPU上,批大小为8时,三层HSTU模型实现最高4.47倍加速,八层模型实现最高5.93倍延迟降低,GPU KV缓存命中率达100%。该方案为生成式推荐模型的高效低延迟部署提供了可复现的实践路径。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅