把 80B 参数的模型跑在 iPhone 上,听着像营销话术,但 Swiftlet 这个新冒出来的运行时正在把它变成可以复现的工程事实。这个用 Swift + Metal 构建的轻量级推理栈,专门瞄准苹果设备,目标很明确:在普通 iPhone、iPad 或 Mac 上直接运行 Qwen3-Next 以及 Qwen3.5/3.6 的混合专家(MoE)模型。它不依赖云端,也不指望你有多少 RAM。做法相当“吝啬”——只把模型里那套小小的稠密核心常驻内存,其他的专家路由权重全留在闪存上,推理时按需流式加载,像翻目录一样调用,用完即丢。
这种 流式专家加载 之所以值得关注,不是因为概念新鲜,而是它给出了具体可量化的内存边界和延迟数字,让开发者能直接估算自己的设备上限,而不是把“端侧大模型”当成又一个商详页的模糊卖点。社区在 Hacker News 上的讨论已经透出一丝兴奋:有人算出某代 iPhone 最多能撑起多少层专家,有人开始拿它试探本地部署的颗粒度。Swiftlet 本质上是在做一道内存带宽与闪存吞吐之间的算术题,但它把题面公之于众,剩下的就是让更多人去算,去优化。对于那些已经厌倦“大模型只能待在云端”叙事的硬件极客和端侧推理玩家来说,这比任何宣传都更有说服力。
项目代码全部开放在 GitHub,名字就叫 Swiftlet。它没有封装成那种一键安装的精致 App,更像一把裸露在工具箱里的扳手——你能清晰地看到 Metal shader 怎么编排,权重窗口怎么滑动。这样的粗糙反而显得诚实。当整个行业还在争论 MoE 是不是端侧的未来,Swiftlet 已经直接把未来拆成了一行行 Swift 代码,丢在普通设备上跑起来了。

