CoreWeave正将战略重心从GPU算力转向AI推理的全栈优化,以应对推理需求快速攀升带来的经济性挑战。其产品副总裁Urvashi Chowdhary指出,客户推理负载占比已从首年的约10%升至次年的40%,预计一年内将达50%。为此,CoreWeave在硬件之上逐层调优,涵盖vLLM引擎、量化模型和定制推测解码器,并坚持基于开源工具构建托管服务。针对强化学习场景中推理成为瓶颈的问题,公司推出基于英伟达Dynamo框架的RL Rollouts预览功能,可将模型检查点重载延迟降低15倍,从而加速智能体模型的迭代与独立扩展。这一布局表明,推理效率正成为决定AI云服务竞争力的关键。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅