是石科技提出了一套面向异构GPU的纯软件推理优化方案,核心思路是通过“算模协同”与“通算重构”两个阶段,弥合模型框架与硬件之间的适配鸿沟。在8张PCIe-Only显卡环境下运行DeepSeek-V4.1-Flash,社区基线输入吞吐仅1932 tok/s,经内核补齐、算子融合、通信重构、并行与显存调优后提升至13274 tok/s,整体吞吐提升6.87倍,并支持1M超长上下文。该方法在DeepSeek-V4-Flash、GLM5.3及MiniMax H3视频生成模型上同样有效,吞吐提升1.55至5.33倍不等。其意义在于证明:通过软件层深度优化,缺乏高速卡间互联的低成本GPU卡可在部分推理指标上逼近高端硬件的服务能力,为算力资源的高效利用提供了新路径。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅