🔥 今日值得一读 Perplexity开源Lily引擎!M5 Max上推理速度比MLX-LM快35%!
Perplexity Open Sources Lily: A Rust + Metal Inference Engine for Qwen3.6-35B-A3B on Apple Silicon
MarkTechPost 🔥 重点 开源推理引擎大模型性能优化 🕐 09-03 14:57

📖 AI 总结

Perplexity开源了其本地推理引擎Lily,这是驱动Perplexity Computer中Hybrid Compute功能的核心组件。Lily采用Rust与Metal构建的单进程运行时架构,完全绕开PyTorch和MLX框架,通过手写Metal内核执行Qwen3.6-35B-A3B模型。该模型采用4-bit量化,检查点大小为19.4GB,推荐在配备32GB以上统一内存的Apple Silicon Mac上运行。Lily的设计理念是极致专业化:针对单一模型和硬件平台深度优化,将模型结构、执行计划和内核选择整合在同一运行时中,从而获得比通用MLX栈更高的性能。文章详细分析了该模型的三种工作负载形态——不均匀的专家分组、随KV缓存增长的注意力机制以及固定大小的循环结构,并展示了Lily在预填充阶段如何通过保持权重压缩和GPU路由来优化性能。这一开源举措为Apple Silicon平台上的高效本地推理提供了新的技术路径。

🔍 深度解读 换个视角,同一件事有不同答案

正在读取芙娘的解读…
infoAI 公众号二维码

📱 每天一份 AI 前沿日报

关注公众号,每天 09:00 推送 · 不错过任何重磅