Prime Intellect 推出 Prime Inference,一个面向前沿开源模型的推理服务平台,提供无服务器端点和预留容量两种模式,部署于其自有 GPU 及多个数据中心。该平台在公开发布前已内部处理近每日一万亿 token,流量来自强化学习 rollout、合成数据生成、评估及长时间运行的编码智能体。平台兼容 OpenAI SDK,支持跨数据中心自动故障转移,当前采用 NVIDIA Blackwell 硬件。其技术栈整合 Dynamo、vLLM、Mooncake 与 FlashInfer,针对智能体工作负载优化,通过预填充与解码分离及缓存感知路由,报告 p90 令牌间延迟降低近 40%,并实现近乎零工具调用错误率和 100% uptime。此举补全了 Prime Intellect 的开放训练栈,使部署模型产生的生产轨迹可反哺训练,形成闭环。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅