把 744B 模型塞进 25GB 内存,他把 SSD 当 L3 缓存用
乌鸦小编 发表于:2026-8-1 00:08 复制链接 发表新帖
阅读数:50
「744B 参数的 MoE 大模型至少需要一张 H100」——这是 2026 年大部分人的共识。一个叫 Vugg 的独立开发者不信这个,他用单一 C 文件(c/glm.c)写了一套推理引擎 colibri,把 GLM-5.2 744B MoE 模型装进 25 GB 内存的笔记本上跑起来了——0.05-0.1 tok/s,速度慢但能跑。整个引擎零依赖:无 BLAS、无 Python runtime、无 GPU 要求。

colibri 的核心思路是把 VRAM、RAM、SSD 当作一个统一的内存层次。GLM-5.2 744B 总参数里只有 40B 是激活的,dense 部分(attention、shared expert、embedding)约 17B 参数在 int4 下约 9.9 GB,可以常驻 RAM;75 层 MoE × 256 个专家 + MTP head(注:multi-token prediction 头,用于投机解码)共 19,456 个 routed expert,每个约 19 MB,总共约 370 GB 留在 SSD 上,按需流式读取。运行时不是把模型「装」进内存,而是把参数当成「需要被分阶段搬运的数据」,router 证明需要哪个 expert 时才搬到 VRAM/RAM。

为这件事 colibri 设计了一套自学习 cache:每层一个 LRU、一个 learned pinned hot-store、一层超前的 prefetch。每轮 token 路由热力图会被记录(.coli_usage),最热的专家自动 pin 住——文档里反复强调的「engine literally gets faster the more you use it」就是这个机制。一个 router-lookahead 线程跑在 PILOT=1 模式下,提前读下一层专家,测得路由 71.6% 是可预测的(layer-ahead)。

硬件加速手段有几个:双 SSD striping 把 9 GB/s + 3 GB/s 的读写带宽聚合起来,专家读取快约 33%;O_DIRECT(DIRECT=1)绕过 page cache,在带 DRAM cache 的 NVMe 上能拿到 +34% decode(4.25→9.69 GB/s iobench);CUDA_EXPERT_GB=auto PIN_GB=all 可以让整个 expert 集常驻显存,decode 路径里 disk 就消失了。Metal 后端在 Apple Silicon unified memory 上跑批量 expert 计算。

实测速度区间:六张 RTX 5090 满驻 5.8-6.8 tok/s,TTFT 约 13 秒;128 GB CPU-only 台式机约 1.8 tok/s warm;单张 RTX 5070 Ti 笔记本级显卡 1.07 tok/s(GPU-resident pipeline);25 GB dev box 0.05-0.1 tok/s cold——这是项目起步的「诚实的地板」,直接挂在 benchmark 表上没藏。

Vugg 没把 colibri 当产品做——他自己说这是 research platform 不是 production runtime,没有 SLA。决策机制是 A/B controlled end-to-end 实验、不是 microbenchmark。代码层面每个优化都被列为 hypothesis 直到 A/B 验证,否则随时可能 revert。比如 MTP head 必须 int8(int4 头部接受率掉到 0-4%)、SPEC_PIN=1 必须把 draft 和 verify 钉在同一个 kernel family(#163 是完整的 forensic 故事)。一个跑了 int4 的镜像在质量上比 group-scaled (gs64) 容器低约 9pp,是 #455 思考模式死循环和生成不终止的根因——这件事在文档的 提醒 警告里讲得很明白。

支持四个模型族:GLM-5.2(744B / 40B)、Inkling(975B / 41B)、Kimi K3(2.8T / 104B)、OLMoE(7B / 1B)。每个模型族一个 sibling engine、同一套前端(coli chat / coli serve / coli web)。GLM-5.2 容器 372 GB,Kimi K3 整 checkpoint 1.6 TB。roadmap 里 Kimi K2、Qwen3 MoE、MiniMax 这些开放权重 MoE 都会按 tiering 算法移植。

项目名 Colibrì 来自意大利语「蜂鸟」——几克重、悬停不动、一天访问一千朵花。这台引擎靠蜂鸟的口粮撑住一个 744B 参数的巨兽:25 GB RAM、12 核 CPU、和足够的磁盘耐心。

Apache 2.0。GLM-5.2 权重本身是 Z.ai 用 MIT 协议发的。

创业找资源,上乌鸦部落
本页内容由网友自行在乌鸦部落发布,本站仅提供帖文、图片存储空间服务,帖文(图片)发布者应自行负责所上传帖文(图片)涉及的法律责任,本站对帖文真实性、版权等概不负责,亦不承担任何法律责任。
条评论
您需要登录后才可以回帖 登录 | 立即注册
高级
相关推荐

关闭

乌鸦部落