Kimi K3 把中国 AI 定价推到了 Claud Sonet 水平:这次不是”追赶”,是”定价权\

7 月 16 日,Simon Willison 发了一篇很简短的文章,主题是用一张”鹈鹕骑自行车”的 SVG 图片测试各版本 AI 模型的效果。这不是什么正经 benchmark,但正因为不正经,反而暴露了最多东西。

鹈鹕测试是这样的: 给模型一个简单 prompt——”生成一只骑自行车的鹈鹕 SVG”。没有任何评分标准,没有任何公开排名,就看模型能不能画出来、画得像不像。

这是 AI 圈子里一个很奇怪的传统:正经 benchmark 往往被过度优化,但一张鹈鹕图,你没法作弊。

而 Kimi K3 生成的鹈鹕,让 Willison 停下来写了整篇文章。

Kimi K3:不是”中国版 GPT-4″,是 3 万亿参数怪兽

Moonshot AI(国内叫月之暗面,海外叫 Moonshot)在 7 月 16 日发布了 Kimi K3,自称”第一个开源 3T-class 模型”——2.5 万亿参数,是上一代 Kimi K2(1 万亿参数)的两倍多。

关键数据来自 Artificial Analysis 的报告:

  • Arena Elo:1547(比 K2 高出 732 点),在开源模型中排名第一
  • Token 效率:输出同样信息比 K2 少用 21% 的 token
  • Benchmark 表现:在大多数测试中超越了 Claude Opus 4.5,但输给 Claude Fable 5 和 GPT-5

这是 Moonshot 第一次用 benchmark 正面叫板顶级闭源模型。

定价才是真正的信号

真正有意思的来了:Kimi K3 的 API 定价是 $3/百万输入 tokens,$15/百万输出 tokens

这个价格意味着什么?

Anthropic 的 Claude Sonnet 系列就是这个价位。Kimi K3 比之前最贵的中国模型定价高了整整一个量级——之前中国 AI 公司的定价策略一直是”比 OpenAI 便宜 70%~80%”,用低价抢市场。

Kimi K3 第一次把价格拉到了和 Anthropic 同一档。

这背后是一个更大的转变:中国 AI 公司不再认为”便宜”是自己的核心竞争力。

85 token 隐藏系统提示词:一次意外发现

Willison 的鹈鹕测试还暴露了一个 Kimi K3 的技术细节——他尝试了最简单的 prompt “hi”,系统计为 86 tokens。这意味着 Kimi K3 有一个约 85 token 的隐藏系统提示词,在用户 prompt 之前注入。

这是业界已知信息,但很少有人认真测过。

更有意思的是同一次测试中,K3 为了生成那张鹈鹕 SVG,消耗了 13,241 个思考 tokens 来输出 3,417 个响应 tokens,总成本 0.25 美元。

0.25 美元生成一张图。这个成本结构,对 AI 编程意味着什么?

一句话总结

Kimi K3 最重要的意义不是”它有多强”,而是”中国 AI 公司终于敢定 Claud Sonet 的价了”。

定价权背后是产品信心。如果你的模型 benchmark 能打 Claude Sonnet,你凭什么比 Claude Sonnet 便宜 70%?

这是中国 AI 产业第一次从”低价抢份额”转向”我有资格定价”。


附:State of Open Source AI 报告关键数据

同一天发布的《The State of Open Source AI》报告(V1.0,2026 年 7 月)给出了几个重要数字:

Agent 工具链的爆发:
– MCP(Model Context Protocol):发布第一年达到 97M 月度 SDK 下载10,000+ 活跃服务器,16 个月增长 4,750%
– LangChain:GitHub stars 超过 126,000,开发者市场份额 60%

开源 vs 闭源能力差距:
– 2024 年 8 月:差距 8.04%
– 2024 年 8 月:缩小到 0.5%
– 2026 年 3 月:重新拉开到 3.3%(闭源推理模型领先)

但 3.3% 是平均值——在代码生成、指令遵循上,开源已经追平;在推理和多模态上,闭源还有优势。

真正的变化不在模型层:

报告里有一句话很关键:”Commodity inputs do not hold pricing power. Value moves up, to the agentic harness.”

模型本身会越来越商品化,但 orchestration layer(编排层)——LangGraph、 CrewAI、LlamaIndex、MCP 这一层——才是真正的产品层,也是价值积累的地方。

这解释了为什么 Cursor、Windsurf 这些 AI 编程工具能在模型能力之外建立独立的用户忠诚度:它们控制的是 harness,不是模型。


来源:
– Simon Willison, “Kimi K3, and what we can still learn from the pelican benchmark”, 2026/07/16, simonwillison.net
– Artificial Analysis Intelligence Index, July 2026
– The State of Open Source AI V1.0, July 2026, stateofopensource.ai

上一篇 Kimi K3 把中国 AI 定价推到了 Claud Sonet 水平:这次不是\"追赶\",是\"定价权\
下一篇 AI 算力投资逻辑正在翻转:训练卡降温,推理卡上位

站点性能

运行正常
实时心跳0 ms
页面加载
0
SQL 查询
0
服务端响应
0 ms
峰值内存
0 MB

探索站点内容

搜索文章、标签、分类

热搜 教程 主题