一个简单的事实正在动摇 AI 行业最重要的假设之一:更大的模型,不一定更可靠。
本周,一个开发者的个人博客在 HN 上拿到了 371 分,引发了激烈讨论。帖子标题很直接:GPT-5.5 hallucinates 3x more than GLM-5.2(GPT-5.5 的幻觉率是 GLM-5.2 的三倍)。
这不是一个技术参数对比,这是关于 AI 可靠性的一次公开打脸。
研究说了什么
作者的基本方法是:在相同的测试条件下,对 GPT-5.5 和 GLM-5.2 进行幻觉率评测。GLM-5.2 是清华智谱(Zhipu AI)的开源模型,采用标准 Attention 架构,MIT 许可证。
结果:GPT-5.5 的幻觉率是 GLM-5.2 的约三倍。
一个关键背景:GLM-5.2 于大约一周前刚刚发布,而 GPT-5.5 是目前参数量最大、能力最强(按多数 benchmark)的闭源模型。规模更大,却更容易产生幻觉——这和行业长期以来的默认假设直接冲突。
HN 讨论区的真实分歧
这个帖子下的讨论比帖子本身更有价值,因为它暴露了 AI 圈深层的路线分歧。
第一派观点:这是”bitter lesson”的延续。
一位开发者引用了 Rich Sutton 的经典文章《The Bitter Lesson》:
当一个技术或方法刚刚出现时,人们通过简单地应用它、收集更多数据、增加资源,就能获得巨大收益。随着时间推移,这些”轻松收益”开始耗尽,公司必须在工程上投入越来越多,以换取每一个小的增量进步。
这派的结论是:AI 模型现在正处于这个曲线的那个”必须拼命工程化”的阶段。大不等于好,因为 easy scaling 已经结束了。
第二派观点:这个对比本身就不公平。
有人在评论里直接质疑:
作者为什么不用 Llama 3 和 GLM-5.2 比较?它们都是标准 Attention 架构的家庭成员,比较两个架构完全不同的模型,然后指出”它们不一样”,这不是什么惊人的发现。
这条评论拿到了不少赞同。它的核心逻辑是:拿 MoE 架构的 GPT-5.5 和标准 Dense 架构的 GLM-5.2 比幻觉率,就像拿跑车和卡车比油耗——对比维度本身就错了。
第三派观点:LLM 架构的碎片化才是真正的问题。
一位开发者的评论引发了最多共鸣:
看 llama.cpp 项目的进展就能感受到——现在的模型太复杂了。DeepSeekv3.2 没有完全实现,KimiK2.6 没有完全实现,DeepSeekv4 根本没有实现,MiniMaxM3 还不支持,Hy3-preview 也不支持。最新的模型只是勉强能跑,大量高级特性缺失。
这指向了一个被忽视的危机:当模型的架构变得如此多样和复杂,连开源社区都跟不上实现的时候,整个 AI 生态系统的透明度在倒退。
为什么这不只是”谁的模型更准”的问题
AI 幻觉率的讨论通常停留在”准确 vs 不准确”的二元对立。但这次争论暴露了一个更根本的问题:我们用来评估 AI 的指标体系本身可能已经过时了。
几个事实:
- 幻觉率没有统一标准。不同团队用不同的测试集、不同的”幻觉”定义,跨模型比较本身就存在方法论问题。
- 闭源模型的可评估性更差。GPT-5.5 是 OpenAI 的闭源模型,外部研究者无法获取完整的训练数据、架构细节、推理过程,只能靠黑盒测试。GLM-5.2 是开源的,MIT 许可证,架构清晰。
- 规模扩大带来的问题不成比例。如果 GPT-5.5 真的幻觉率是 GLM-5.2 的 3 倍,这意味着 AI 行业需要重新审视”scaling law”的边界。
我的判断
这份研究的方法论是否严谨,需要更多独立验证。但它提出的问题本身是正确的:AI 行业对”更大=更好”的信仰,正在遇到反例。
更深的问题是:当评估体系、模型架构、训练数据都变得越来越不透明的时候,整个行业对”什么是好的 AI”的判断,正在失去共同基础。
这不是某一家公司的问题。这是整个 AI 行业在快速发展中累积的系统性风险。
相关数据:
– GPT-5.5 幻觉率:测试集标准下约为 GLM-5.2 的 3 倍(来源:arrowtsx.dev 评测,2026-06-19)
– GLM-5.2:清华智谱(Zhipu AI)发布,采用标准 Transformer + Dense 架构,MIT 开源协议(2026年6月上旬发布)
– HN 讨论帖:371 points,171 comments(截至2026-06-20)