Kimi K3 的权重终于在 HuggingFace 正式公开了。
上周你们看到的是定价新闻——Kimi K3 API 便宜到让 Claud Sonet 难堪。但今天这个,是另一件事:权重开源。这意味着任何人可以下载、部署、量化、微调,不再受 API 限制。
这件事值得关注的原因,不只是”又一个开源大模型”。
技术上真正新的东西
1. Kimi Delta Attention(KDA)+ Attention Residuals(AttnRes)
这是 K3 架构的核心,也是之前没被详细解释的部分。官方说法是:通过 KDA 和 AttnRes,K3 在 MoE 稀疏性上做了 scaling 效率提升——激活 16 / 896 个 experts,相比 Kimi K2 整体效率提升约 2.5 倍。
不是简单放大参数,而是用更少的激活参数做更多的事。这是工程上的差异,不是数字上的差异。
2. Native MXFP4 量化
K3 是原生 MXFP4模型,不是先训 FP16 再后量化——从训练阶段就是按 MXFP4 设计的。
HN 上有评论算了这笔账:
“depending on where the median pricing settles w/ 3rd party providers will tell us what it costs to serve a 3T model. Since it’s going to be mxfp4 native, it’ll take ~1.5TB of VRAM to host this”
1.5TB VRAM,现在能跑动它的硬件大概需要 8×B200(实际建议 16×)。这不是普通开发者能碰的东西。
3. 1M token 上下文
这是目前开源权重模型里最长的上下文窗口之一。BrowseComp 测试中,K3 在 300K token 触发 context-compaction 策略的情况下达到了 90.4 分;用完整 1M 窗口且不做 context management 时,同样是 90.4——说明它的 1M 窗口不是”能跑但效果差”,是真正有效的。
真正有意思的讨论点
HN 上有一条评论问得好:
“Given the frontier-level capabilities of Kimi K3, I’m wondering if it’s possible to extract the core capabilities (fundamental reasoning and tool calling) of the model into a smaller one that consumer devices could run?”
这才是 K3 开源之后最重要的问题。K3 是 MoE 架构(896 experts),这意味着理论上可以从 2.8T 里 distill 出一个子集,保留核心的 reasoning + tool calling 能力,但体积小到消费级硬件能跑。
目前没有人做这件事,但有人已经在想这件事了。
还有一条评论更务实:
“Its now on Nebius: $3.00 / 1M In; $15.00 / 1M Out; 120 Tok/s. But since Nebius doesn’t offer prompt caching, its essentially useless.”
这告诉我们两件事:1)第三方 providers 已经在上了;2)没有 prompt caching 的 3T 模型,推理成本高到不实用。
为什么这不只是”又一个大模型”
中国 AI 公司之前开源的模型,核心逻辑基本是:我训练了一个大模型,现在把权重给你。
Kimi K3 不一样。它的架构(KDA + AttnRes + Stable LatentMoE)是首次随权重公开一起发布的——这意味着这次开源的不只是权重,是一整套技术方案的验证。
对于 AI 研究者和 infra 工程师来说,这才是有价值的部分:你可以直接研究 2.8T 参数的 MoE 模型是怎么解决 expert routing 效率问题的,而不是只能拿到一个黑箱权重。
对开发者意味着什么
如果你想现在就跑 K3:
- FP16 全精度:需要 ~1.5TB VRAM,几乎只有 H100 集群才可能
- 原生 MXFP4:硬件要求最低的版本,但目前只有 Moonshot 官方和一些 early providers 上了
- 量化版(Q4/Q8):社区还没完成测试,有人在做,但HN评论普遍不看好 Q4/Q6——”lost knowledge but also not reliable output that comes out too slow”
对于普通开发者,现在最实际的用法是等量化版稳定,或者直接用 API。但如果你对 MoE 架构、量化技术或者长上下文训 Instruct Tuning,K3 的权重是很好的研究素材。
Kimi K3 开源这件事,真正有意思的地方不是”中国又出了一个厉害模型”——而是这是中国公司第一次把自己模型的核心架构创新和权重一起开放出来。下一步看社区能不能在上面做出有趣的东西。