在 M1 Max 上运行 2.8T 参数的 Kimi K3:Deltafin 项目实现 0.0687 token/s 推理

发布时间: 2026-07-29 文章分类: AI前沿技术
阅读量: 0
AI智能体
企业级AI智能体开发与部署
LumeValley提供全栈式企业级AI智能体开发与部署服务,涵盖战略规划、场景化开发、企业级应用构建、行业解决方案及算力支撑。从需求分析到持续优化,确保智能体高效稳定运行,助力企业实现智能化转型,提升运营效率与竞争力。

一帮人硬是把 2.8 万亿参数的 Kimi K3 塞进了一台 64GB 内存的 M1 Max,然后面不改色地告诉你:它真的能跑。Deltafin 这个开源项目让消费级笔记本吞下了一座参数巨兽,推理速度中位数 0.0687 token/s,换算过来就是 14.6 秒才吐出一丁点输出。慢吗?慢得离谱。重要吗?比跑分重要得多。因为这根本不是在拼速度,而是在拆掉大模型必须绑在数据中心机柜上的那根锁链。

磁盘在烧,模型在喘:1.7TB 的物理条件

64GB 统一内存怎么接住 2.8T 参数

MoE,也就是混合专家,确实是这里唯一的救命稻草。Kimi K3 虽然总参数量膨胀到 2.8 万亿,但每次前向计算只激活一小撮专家分支,真实的计算量和内存占用远没有数字看上去那么恐怖。Deltafin 的玩法相当粗暴:利用 Apple Silicon 的统一内存架构,把整个模型权重通过内存映射直接钉在 SSD 上,让 macOS 的虚拟内存交换 去兜底。你在跑推理的时候,能听见风扇起来,但真正嘶吼的是那根 NVMe 硬盘——模型参数在物理内存和闪存之间疯狂搬运,每一 byte 的延迟都变成 token 生成计时器上的一个跳字。

先选择你的痛苦:全量下载还是流式模式

项目给了两条路,两条都很疼。完整安装需要大约 1.7TB 的本地磁盘空间,你得先老老实实把 Kimi K3 的全部权重拉下来,然后 M1 Max 才能在你面前表演那 0.0687 token/s 的“高速”推理。流式模式只需要 215GB,代价是把推理速度直接拖进 3 分钟以上/token 的深渊。换句话说,要么你的 SSD 被掏空,要么你的耐心被掏空。没有中间态。

不是推理,是一场 SSD 耐力测试

当每秒要处理的权重访问量远超物理内存带宽,Deltafin 实质上变成了一台精密的数据搬运机器。有人开玩笑说,这跑的不是语言模型,是闪存磨损测试。但玩笑归玩笑,这种暴力打穿统一内存与 NVMe 交换边界的做法,恰好戳痛了当前硬件架构的一块旧伤疤:我们一直把模型当成必须常驻显存的东西,却忘了虚拟内存这个老机制在苹果芯片上已经足够快,快到可以支撑一种“勉强可用”的巨型模型推理。

API 就绪,但请先调高你的超时阈值

OpenAI 兼容接口,curl 连上去,然后去喝杯咖啡

Deltafin 标配了一个 OpenAI 兼容的 API 服务器,支持聊天和代码补全。这意味着你完全可以把它挂成本地推理后端,用习惯的工具链去访问那团正在 M1 Max 里缓慢翻涌的参数。只不过,项目文档里有一句建议堪称年度最诚实技术注释:建议客户端超时设为小时级别。不是毫秒,不是秒,是小时。当你用 curl 发出一条对话请求,足够出门吃顿午饭,回来可能才刚生成到第二个句子。

0.07 token/s 的聊天机器人,你受得了吗

以 0.0687 token/s 的中位速度运行对话,意味着最简单的问候也要等上几分钟。模型没法被用在任何实时交互场景里,甚至异步都嫌慢。但这种龟速并非毫无意义:它证明了在消费级设备上,超大规模 MoE 模型确实可以完成完整的前向推理,而不依赖任何云端卸载或量化压缩。之前没人认真试过在 M1 Max 上干这事,Deltafin 直接拿 K3 开刀,等于在说——能跑起来本身,就是唯一的产品形态

代码补全?等你补完我早就写完了

场景切换到代码补全会更加荒诞。你敲下一个注释,等模型吐出一个函数签名时,你手写的实现已经通过测试了。但这同样暴露了一个有趣的事实:即便是这种几乎无法忍受的延迟,对于批处理任务、离线数据生成、夜深人静时慢慢跑的长文本补充,仍然具备微弱的实用价值。只要愿意把“响应”重新定义为“我明天再来看结果”,Deltafin 就能从一个玩具变成一个能运转的异类工具。

重新画一条端侧的线

这不是产品,这是一次极限运动的性能艺术

用“工程 hack”来形容 Deltafin 都算客气。它没有做任何模型压缩,也没有试图用 adapter 或者蒸馏去取巧,就是把 2.8T 参数的原始模型摁进一台笔记本的躯壳里,然后盯着 Activity Monitor 里狂飙的内存压力图发笑。这种暴力美学在 AI 圈早就稀缺——当所有人都在卷推理框架、拼 token 吞吐量时,这个项目选择走向另一个极端:拿空间换可能性,哪怕慢到被嘲笑。它更像一场行为艺术,告诉行业,你们的模型再大,也拦不住有人用最笨的方法在最低配的硬件上把它点亮。

玩硬件的那拨人已经在想怎么贡献数据了

Deltafin 发布后最先沸腾的不是 NLP 圈,而是那群喜欢折腾硬件的极客。不同版本 M1、M2、M3 的内存带宽差异、SSD 速度、swap 策略都会直接影响那可怜巴巴的 0.0x token/s。于是社区里开始冒出一个声音:要不要做个基准,专门测各种共识下“不可能跑起来的配置”?一个需要小时级超时的推理引擎,反而激发出一股收集边缘案例的冲动,这正是开源项目最健康的初期状态。

当 Apple Silicon 的统一内存架构变成一块试验田

M 系列芯片的统一内存从一开始就被视为 AI 推理的潜在变量。以前人们只敢讨论 70 亿、130 亿参数的模型能跑在多少 GB 内存上,Deltafin 直接把数字拉到万亿级,即便靠的是无尽的交换。这实际上给芯片设计侧提了个醒:如果未来消费级硬件的 SSD 延迟再降一个数量级,内存一致性做得再激进一点,那么今天这种看似荒谬的慢吞吞推理,明天就有可能逼近可用的边缘。真正限制巨型 MoE 进入个人设备的,不全是算力,而是人们没有认真想象过交换内存能扮演的角色。

边缘推理的定义,被这个项目往左平移了一格

以前我们说“端侧推理”,默认是跑一个量化后的 7B 模型,响应在百毫秒内。Deltafin 把这个定义撕了:端侧也可以托管一个不量化、不蒸馏、完整激活专家路径的超级 MoE,只是时间单位得改成小时。这不是所有人都能接受的折衷,但它在分类学上创造了一个新格子——高延迟本地巨型模型。对于某些离线数据分析、敏感内容处理、断网环境长文本生成来说,这个格子里放着的可能刚好是块合适积木。

2.8T 参数在 M1 Max 上以 14.6 秒/ token 的速度爬行,Deltafin 用最不优雅的方式做了一件很优雅的事:它证明了大模型的物理边界并非铜墙铁壁,而是一道可以用虚拟内存、SSD 耐久度和无限耐心合力凿穿的薄墙。接下来要等的,只是硬件演进让这面墙变得更薄。

AI智能体
企业级AI智能体开发与部署方案
LumeValley打造企业级AI智能体全流程方案,涵盖需求洞察、定制开发、多平台适配部署。凭借专业算法与丰富经验,确保智能体精准理解业务,高效执行任务,无缝融入企业生态,为企业数字化转型提供强劲智能引擎,提升核心竞争力。
点赞 | 95

Lumevalley——全栈AI服务领航者,以“战略-应用-算力”三位一体服务框架,为企业提供从顶层战略规划、场景化AI智能体(AI Agent)开发/搭建/部署,到企业级AI应用开发、AI+行业场景解决方案的全链路服务,并配套AI大模型部署与高性能AI算力底座支撑,助力客户在营销、服务、运营等核心环节实现效率倍增与模式创新。

马上扫码获取产品资料
相关文章

相关文章

填写以下信息, 免费获取方案报价
姓名
手机号码
企业名称
  • 建筑建材
  • 化工
  • 钢铁
  • 机械设备
  • 原材料
  • 工业
  • 环保
  • 生鲜
  • 医疗
  • 快消品
  • 农林牧渔
  • 汽车汽配
  • 橡胶
  • 工程
  • 加工
  • 仪器仪表
  • 纺织
  • 服装
  • 电子元器件
  • 物流
  • 化塑
  • 食品
  • 房地产
  • 交通运输
  • 能源
  • 印刷
  • 教育
  • 跨境电商
  • 旅游
  • 皮革
  • 3C数码
  • 金属制品
  • 批发
  • 研究和发展
  • 其他行业
需求描述
填写以下信息马上为您安排系统演示
姓名
手机号码
你的职位
企业名称

恭喜您的需求提交成功

尊敬的用户,您好!

您的需求我们已经收到,我们会为您安排专属电商商务顾问在24小时内(工作日时间)内与您取得联系,请您在此期间保持电话畅通,并且注意接听来自广州区域的来电。
感谢您的支持!

您好,我是您的专属产品顾问
扫码添加我的微信,免费体验系统
(工作日09:00 - 18:00)
电话咨询 (工作日09:00 - 18:00)
客服热线: 18011747352
售前热线: 189 2432 2993
扫码即可快速拨打热线