8GB 内存跑 26B 模型,他用 SSD 当外置显存
乌鸦小编 发表于:2026-8-1 00:05 复制链接 发表新帖
阅读数:54
8 GB 内存跑不动 26B 模型——这是 2025 年本地 AI 的硬天花板。一个叫 Andrey Mikhaylov 的 iOS + Metal 工程师不信这个,他用 Swift + Metal 从头写了一套推理运行时 TurboFieldfare(注:把 26B 参数大模型塞进 8 GB 内存的 Mac 端侧方案),把 Gemma 4 26B-A4B 塞进了一台 8 GB 内存的 M2 MacBook Air。

整套方案的关键不是压缩专家本身。MoE 模型 26B 总参数里只有 3.88B 是激活的,共享部分 1.35 GB 可以常驻内存,但 16 个专家加起来还有大约 13 GB。Mikhaylov 的做法是:共享权重和 FP16 KV cache 装进 RAM,路由出来的 Top-8 专家按 token 流从 SSD 拉,通过 bounded parallel pread 喂给 Metal 可见缓冲区。M2 Air 实测 5.1-6.3 tok/s,M5 Pro 31-35 tok/s。安装包不下载完整 checkpoint,只拉需要的 byte range 重打包成 .gturbo 布局,磁盘占用 14.3 GB。

但更值得注意的是这个项目的来历。Mikhaylov 自述工作内容是图像、视频和端侧 AI——TurboFieldfare 是独立研究项目,没拿到 Google 赞助。README 里 103 条实验记录里写了 8 个失败的尝试和它们的反向结果。Mac 端的 SwiftUI/AppKit app、CLI、本地 loopback 接口、本地 decode service 全部自己写,不用 MLX 也不包 llama.cpp。模型特定,是给 Gemma 4 26B-A4B 写的,不是通用 wrapper。

对独立开发者来说,这事意味着 Apple Silicon 8 GB 的门槛比想象的低——只要愿意把 SSD 当外置显存写自定义 runtime,3.88B 激活的 MoE 模型可以跑 5-6 tok/s,足够本机写代码助手和单轮问答。但前提是会写 Metal 内核。TurboFieldfare 给出了完整的系统设计文档(Metal kernels、router handoff、cb1 / io / cb2 阶段),社区可以照着改其它 MoE 架构。下一步是 iPhone 和 iPad 移植,计划把 16 GB M4 Mac mini 加进基准测试集。

项目名来自 fieldfare——一种灰扑扑但性格独特的椋鸟,作者特意解释他不是要做最实用的工具,只是用最爱的工具 Metal 写最爱的领域,端侧 ML 推理。开源协议 Apache 2.0,模型权重单独从 Hugging Face 拉,受原条款约束。

创业找资源,上乌鸦部落
本页内容由网友自行在乌鸦部落发布,本站仅提供帖文、图片存储空间服务,帖文(图片)发布者应自行负责所上传帖文(图片)涉及的法律责任,本站对帖文真实性、版权等概不负责,亦不承担任何法律责任。
条评论
您需要登录后才可以回帖 登录 | 立即注册
高级
相关推荐

关闭

乌鸦部落