资讯

Perplexity Open Sources Lily: A Rust + Metal Inference Engine for Qwen3.6-35B-A3B on Apple Silicon

marktechpost.com·2026/9/3 06:57:07🔗 原文

📋总体概括

Perplexity开源了本地推理引擎Lily,这是其Perplexity Computer中Hybrid Compute功能背后的核心组件。Lily用Rust编写,针对Qwen3.6-35B-A3B单一模型和Apple Silicon单一芯片家族定制Metal内核。在40核、128 GB的M5 Max上,Lily的prefill吞吐量平均达到MLX-LM的1.23倍,decode吞吐量达到1.35倍。这一开源动作展示了为特定模型和硬件深度定制推理栈所能带来的性能收益,也为Mac本地大模型推理生态提供了新参考。

关键信息

  • Perplexity开源本地推理引擎Lily,源自Perplexity Computer的Hybrid Compute功能
  • Lily采用Rust编写,并使用定制Metal内核,专注单一模型与单一芯片家族
  • 测试平台为40核、128 GB的M5 Max,跑的是Qwen3.6-35B-A3B
  • 相比MLX-LM,Lily平均prefill吞吐量提升至1.23倍,decode提升至1.35倍

🔥犀利点评

为「一个模型+一个芯片家族」做深度定制,换来1.23x/1.35x的提升,这个账算得精明:MoE小激活模型恰恰是最吃内存带宽和调度细节的场景,通用框架的抽象层就是纯开销。开源更是一石二鸟——既给Mac本地推理社区送人情,又为自家Perplexity Computer的本地策略背书。但别神话:换一个模型,这些手工Metal内核的价值就要重新验证,极致定制和通用性从来不可兼得。

本文由本站自动聚合,以下为原始来源:前往 marktechpost.com 阅读全文