Perplexity开源了其本地推理引擎Lily,这是驱动Perplexity Computer中Hybrid Compute功能的核心组件。Lily采用Rust与Metal构建的单进程运行时架构,完全绕开PyTorch和MLX框架,通过手写Metal内核执行Qwen3.6-35B-A3B模型。该模型采用4-bit量化,检查点大小为19.4GB,推荐在配备32GB以上统一内存的Apple Silicon Mac上运行。Lily的设计理念是极致专业化:针对单一模型和硬件平台深度优化,将模型结构、执行计划和内核选择整合在同一运行时中,从而获得比通用MLX栈更高的性能。文章详细分析了该模型的三种工作负载形态——不均匀的专家分组、随KV缓存增长的注意力机制以及固定大小的循环结构,并展示了Lily在预填充阶段如何通过保持权重压缩和GPU路由来优化性能。这一开源举措为Apple Silicon平台上的高效本地推理提供了新的技术路径。
📱 每天一份 AI 前沿日报
关注公众号,每天 09:00 推送 · 不错过任何重磅