Kimi-K3 在 HuggingFace 上线,3 万亿参数开源大模型开价
乌鸦小编 发表于:2026-7-27 23:46 复制链接 发表新帖
阅读数:168
Kimi-K3 在 HuggingFace 上以 mxfp4 原生格式发布。模型规模约 3 万亿参数,开发者社区估算完整部署需要 1.5TB VRAM,8 张 B200 显存刚好勉强够用,但要兼顾 context length 和吞吐量实际需要 16 张。模型原生支持 mxfp4 量化意味着开发者可以以更低的显存代价运行,但精度损失如何仍待实际推理测试。这是月之暗面第一次以开源权重形式发布旗舰级模型。

API 提供商的报价会成为这个模型成本结构的关键观察点。开发者社区反复提到一个核心问题:如果实验室在 API 价格上亏本补贴,那么从开源权重价格倒推出来的 inference cost 就不再是真实成本。3 万亿参数模型的推理成本是结构性事件——一旦开源权重出现,外部 API 价格会快速回归到接近 inference 边际成本的水平。这种价格透明化过程对所有闭源模型提供商都是压力,SemiAnalysis 给出的 Anthropic 60% 综合毛利率、API 业务超过 80% 毛利率的数据是这次价格战的对照系。

微调生态是这个模型落地的关键指标。开发者社区已经在讨论是否应该用 GGUF 取代 bitsandbytes 4-bit 作为微调基础格式。GGUF 格式的优势是支持更新的模型架构和更激进的量化方案,已经有人在 16GB VRAM 上成功微调 Qwen3.5-35B-A3B,在 90GB VRAM 上微调 DeepSeek-V4-Flash 这类 280B-A13B 模型。但 Kimi-K3 这样的 3T 模型仍然需要多 GPU 多节点训练,单卡微调不现实。Composer 系列训练是否有新一轮基于 Kimi-K3 的微调,是社区密切关注的下一波事件。

模型蒸馏可能性是另一个关键变量。如果社区成功把 Kimi-K3 蒸馏到 100B 以下的小模型(比如 dsv4-kimi 这种组合),下游开发者可以用更低成本获得近似能力。蒸馏的关键是训练整个分布而不是简单 teacher-forcing,这种 proper distillation 在 dsv4 这种本身训练效率很高的 base model 上产出比预期要好。

回到开源生态本身,Kimi-K3 在 AISI benchmark 上的 cybersec 评分高于 GLM5.2 但仍远落后于最强闭源模型。这意味着开源大模型和闭源旗舰之间的能力 gap 没有完全消失,但开源生态在特定领域已经达到了可用的水位。对中国开发者来说,国产开源大模型能够追上 GLM 系列并且具备 SOTA 级别的 cybersec 能力是个明显进步。这个里程碑也会推动 HuggingFace 上的中国开源模型板块进一步壮大。

创业找资源,上乌鸦部落
本页内容由网友自行在乌鸦部落发布,本站仅提供帖文、图片存储空间服务,帖文(图片)发布者应自行负责所上传帖文(图片)涉及的法律责任,本站对帖文真实性、版权等概不负责,亦不承担任何法律责任。
条评论
您需要登录后才可以回帖 登录 | 立即注册
高级
相关推荐

关闭

乌鸦部落