每隔几周发布一个前沿模型,已经成了 2026 年 AI 圈的常态。Claude Fable、GLM5.2、Minimax M3——这些模型名字密集出现在过去两个月的发布日志里。但,很少有人认真问一句:这些模型的推理成本,谁在扛?
答案是:NVIDIA Blackwell 在涨价,而且越来越贵。GPU 供给追不上模型发布的频率,tokens 的价格降不下来。
上周,推理服务商 Wafer Labs 发了一组数据,把这个矛盾说得很清楚:他们用 AMD MI355X 跑 GLM5.2,实测 2626 tok/s/node,213 tok/s 单流吞吐,成本比 NVIDIA Blackwell 低一倍以上。
三个硬数据
第一个数字:2.75x
AMD MI355X 相比 NVIDIA B300 的单卡价格差。在这个数字出现之前,业界默认 NVIDIA 是 AI 推理的唯二选择,没有人会认真考虑 AMD。但 Wafer 的实测改写了这个前提——同等硬件规格,AMD 便宜 2.75 倍。
第二个数字:213 tok/s
这是 GLM5.2 在 AMD MI355X 单流推理时的速度。这个数字意味着什么?对比一下:Claude Fable 单流大概在 150-180 tok/s 区间。GLM5.2 作为一个非美国模型,在 AMD 卡上跑出了比 Claude Fable 更快的单流速度。
第三个数字:2626 tok/s/node
集群吞吐。Wafer 用了多卡并跑出了这个数字——对于需要高并发的 API 服务来说,这个指标直接影响单位 token 的边际成本。
为什么 Blackwell 越来越贵
原因很简单:供需失衡。
每个大厂都在囤卡。OpenAI 建数据中心,Google 追加算力预算,Meta 的推理需求一年翻三倍——所有人都去抢同样的 SKU,NVIDIA 的定价权就越来越强。
加上出口管制的影响,中国市场能拿到的 NVIDIA 高端卡越来越少。GLM、Qwen、DeepSeek 这些中国模型,在 NVIDIA 供应不足的情况下,被迫寻找替代方案。AMD 成了最现实的选择。
这不是 AMD 第一次想进 AI 推理市场。MI300X 时代已经有人在用,但当时生态不成熟,ROCm 的坑太多,大多数公司还是选择 CUDA 生态更完整的 NVIDIA。
2026 年的情况不一样了。MI355X 的软件栈相对完善,ROCm 6.x 的兼容性大幅改善,加上成本压力——很多公司开始认真做迁移评估。Wafer 的这篇博客,就是这个迁移评估的结果。
算力格局正在被改写
我之前写 AI 商业化的时候,反复提过一个观点:AI 基础设施的利润,正在从芯片层向推理服务层转移。NVIDIA 卖卡是赚的,但推理服务商的价格战会越来越激烈——因为算力的供给在增加。
AMD 插进来,会加速这个过程。2.75 倍的价格差,对任何规模化的推理业务都是致命诱惑。可以预见,会有更多推理服务商开始测试 AMD 方案。
对模型公司来说,这意味着:
– 推理成本会下降,token 价格战的底气更足
– 非 NVIDIA 架构的优化会变多(AMD、国产 GPU 都算)
– NVIDIA 的定价权会被逐步侵蚀,但这个过程很慢
真正的竞争还没开始
但也别高估 AMD 的威胁。NVIDIA 的护城河不只是芯片——CUDA 生态、TensorRT、NVLink 这些软件层的积累,AMD 三年内追不上。Wafer 能用 AMD 跑通 GLM,不代表整个行业能立刻切过去。
真正的格局变化,要看推理服务商的态度。如果有头部公司公开宣布”我们开始用 AMD 跑部分模型”,那才是真正的信号。
现在只是有人在试水。
但 2x 以上的成本差,已经足够让这个试水动作,变得很认真了。
本文相关平台:
Roogoo 虚拟卡:0开卡费、0年费、0额度费,USDT出入金,ChatGPT/Claude订阅必备。查看申请教程
MiPay:免KYC消费USDT,OTC中文客服,出入金更灵活。了解 MiPay