独家:Iterate.ai新引擎让单GPU跑AI代理会话数暴增6倍!
Exclusive: Iterate.ai’s Lifeboat runs up to six times more AI agent sessions per GPU
SiliconANGLE 重要 Agent算力商业化 🕐 今天 21:00

📖 AI 总结

Iterate.ai 推出面向大语言模型的推理引擎 Lifeboat,内置机密计算能力,主打解决 AI 智能体规模化运行时的显存瓶颈。由于智能体执行单个任务会触发数十次模型调用,上下文窗口持续膨胀,极易占满键值缓存,标准推理引擎在四五个长上下文请求并发时便会停滞。Lifeboat 通过公平调度、准入控制、键值缓存优化以及混合专家模型的按需加载,在不降低模型权重精度的前提下提升并发能力。在单块英伟达 RTX PRO 6000 Blackwell GPU 上运行 Qwen 30B-A3B 模型的测试中,Lifeboat 支持 2048 个并发会话且全部完成,吞吐量达每秒 8714 个 token,而关闭优化后仅约一半会话数、每秒 4965 个 token;在 128 个会话、每个请求 18000 token 的显存压力测试中,其首 token 延迟的第 99 百分位为 1.5 秒,基线则需 189 秒。该引擎意在让银行、保险和医疗等机构在自有环境内运行智能体,无需为扩容而追加 GPU 采购。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅