Perplexity工程团队近期公开了其GPU嵌入服务栈的技术细节,聚焦于支撑pplx-embed及排名模型的推理基础设施。文章指出,嵌入推理在GPU端已趋同,性能提升主要来自运行时优化:包括CUDA图管理、异步结果追踪抽象及Rust请求路径。Perplexity将嵌入服务分为批量嵌入(建索引时重吞吐)与在线嵌入(查询时重延迟)两种模式,但并未构建独立引擎,而是复用其LLM栈中的prefill和decode内核。系统由三个组件协同:Ivy作为Rust HTTP网关处理CPU端任务与负载均衡;Tulip是基于Rust的gRPC推理服务器,负责调度与批处理;ROSE则是以Python为主的运行时引擎,实现模型推理与CUDA图管理。这一设计通过统一引擎应对不同流量模式,兼顾成本与性能。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅