Prime Inference上线!单用户101 tok/s,一个预填充组扛66会话
Prime Intellect Launches Prime Inference: Serverless and Reserved Serving for Frontier Open Models
MarkTechPost 重要 开源算力大模型 🕐 今天 13:37

📖 AI 总结

Prime Intellect 推出 Prime Inference,一个面向前沿开源模型的推理服务平台,提供无服务器端点和预留容量两种模式,部署于其自有 GPU 及多个数据中心。该平台在公开发布前已内部处理近每日一万亿 token,流量来自强化学习 rollout、合成数据生成、评估及长时间运行的编码智能体。平台兼容 OpenAI SDK,支持跨数据中心自动故障转移,当前采用 NVIDIA Blackwell 硬件。其技术栈整合 Dynamo、vLLM、Mooncake 与 FlashInfer,针对智能体工作负载优化,通过预填充与解码分离及缓存感知路由,报告 p90 令牌间延迟降低近 40%,并实现近乎零工具调用错误率和 100% uptime。此举补全了 Prime Intellect 的开放训练栈,使部署模型产生的生产轨迹可反哺训练,形成闭环。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅