🔥 今日值得一读 1.5台6000D跑赢1台B300!PCIe显卡DeepSeek推理吞吐暴涨近7倍
PCIe显卡被低估了!内核补齐+通信重构,DeepSeek推理吞吐翻近7倍
量子位 🔥 重点 算力大模型 🕐 09-24 22:17

📖 AI 总结

是石科技提出了一套面向异构GPU的纯软件推理优化方案,核心思路是通过“算模协同”与“通算重构”两个阶段,弥合模型框架与硬件之间的适配鸿沟。在8张PCIe-Only显卡环境下运行DeepSeek-V4.1-Flash,社区基线输入吞吐仅1932 tok/s,经内核补齐、算子融合、通信重构、并行与显存调优后提升至13274 tok/s,整体吞吐提升6.87倍,并支持1M超长上下文。该方法在DeepSeek-V4-Flash、GLM5.3及MiniMax H3视频生成模型上同样有效,吞吐提升1.55至5.33倍不等。其意义在于证明:通过软件层深度优化,缺乏高速卡间互联的低成本GPU卡可在部分推理指标上逼近高端硬件的服务能力,为算力资源的高效利用提供了新路径。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅