GPT-5.5 幻觉率是 GLM-5.2 的 3 倍:模型越大越会说谎?这份研究炸出了 AI 圈最尴尬的分歧


一个简单的事实正在动摇 AI 行业最重要的假设之一:更大的模型,不一定更可靠。

本周,一个开发者的个人博客在 HN 上拿到了 371 分,引发了激烈讨论。帖子标题很直接:GPT-5.5 hallucinates 3x more than GLM-5.2(GPT-5.5 的幻觉率是 GLM-5.2 的三倍)。

这不是一个技术参数对比,这是关于 AI 可靠性的一次公开打脸。

研究说了什么

作者的基本方法是:在相同的测试条件下,对 GPT-5.5 和 GLM-5.2 进行幻觉率评测。GLM-5.2 是清华智谱(Zhipu AI)的开源模型,采用标准 Attention 架构,MIT 许可证。

结果:GPT-5.5 的幻觉率是 GLM-5.2 的约三倍。

一个关键背景:GLM-5.2 于大约一周前刚刚发布,而 GPT-5.5 是目前参数量最大、能力最强(按多数 benchmark)的闭源模型。规模更大,却更容易产生幻觉——这和行业长期以来的默认假设直接冲突。

HN 讨论区的真实分歧

这个帖子下的讨论比帖子本身更有价值,因为它暴露了 AI 圈深层的路线分歧。

第一派观点:这是”bitter lesson”的延续。

一位开发者引用了 Rich Sutton 的经典文章《The Bitter Lesson》:

当一个技术或方法刚刚出现时,人们通过简单地应用它、收集更多数据、增加资源,就能获得巨大收益。随着时间推移,这些”轻松收益”开始耗尽,公司必须在工程上投入越来越多,以换取每一个小的增量进步。

这派的结论是:AI 模型现在正处于这个曲线的那个”必须拼命工程化”的阶段。大不等于好,因为 easy scaling 已经结束了。

第二派观点:这个对比本身就不公平。

有人在评论里直接质疑:

作者为什么不用 Llama 3 和 GLM-5.2 比较?它们都是标准 Attention 架构的家庭成员,比较两个架构完全不同的模型,然后指出”它们不一样”,这不是什么惊人的发现。

这条评论拿到了不少赞同。它的核心逻辑是:拿 MoE 架构的 GPT-5.5 和标准 Dense 架构的 GLM-5.2 比幻觉率,就像拿跑车和卡车比油耗——对比维度本身就错了。

第三派观点:LLM 架构的碎片化才是真正的问题。

一位开发者的评论引发了最多共鸣:

看 llama.cpp 项目的进展就能感受到——现在的模型太复杂了。DeepSeekv3.2 没有完全实现,KimiK2.6 没有完全实现,DeepSeekv4 根本没有实现,MiniMaxM3 还不支持,Hy3-preview 也不支持。最新的模型只是勉强能跑,大量高级特性缺失。

这指向了一个被忽视的危机:当模型的架构变得如此多样和复杂,连开源社区都跟不上实现的时候,整个 AI 生态系统的透明度在倒退。

为什么这不只是”谁的模型更准”的问题

AI 幻觉率的讨论通常停留在”准确 vs 不准确”的二元对立。但这次争论暴露了一个更根本的问题:我们用来评估 AI 的指标体系本身可能已经过时了。

几个事实:

  • 幻觉率没有统一标准。不同团队用不同的测试集、不同的”幻觉”定义,跨模型比较本身就存在方法论问题。
  • 闭源模型的可评估性更差。GPT-5.5 是 OpenAI 的闭源模型,外部研究者无法获取完整的训练数据、架构细节、推理过程,只能靠黑盒测试。GLM-5.2 是开源的,MIT 许可证,架构清晰。
  • 规模扩大带来的问题不成比例。如果 GPT-5.5 真的幻觉率是 GLM-5.2 的 3 倍,这意味着 AI 行业需要重新审视”scaling law”的边界。

我的判断

这份研究的方法论是否严谨,需要更多独立验证。但它提出的问题本身是正确的:AI 行业对”更大=更好”的信仰,正在遇到反例。

更深的问题是:当评估体系、模型架构、训练数据都变得越来越不透明的时候,整个行业对”什么是好的 AI”的判断,正在失去共同基础。

这不是某一家公司的问题。这是整个 AI 行业在快速发展中累积的系统性风险。

相关数据
– GPT-5.5 幻觉率:测试集标准下约为 GLM-5.2 的 3 倍(来源:arrowtsx.dev 评测,2026-06-19)
– GLM-5.2:清华智谱(Zhipu AI)发布,采用标准 Transformer + Dense 架构,MIT 开源协议(2026年6月上旬发布)
– HN 讨论帖:371 points,171 comments(截至2026-06-20)


上一篇 AlphaFold 负责人离开 Google 加入 Anthropic:AI for Science 的人才正在重新洗牌
下一篇 特朗普打击Anthropic,受益者可能不是你想的那些公司

站点性能

运行正常
实时心跳0 ms
页面加载
0
SQL 查询
0
服务端响应
0 ms
峰值内存
0 MB

探索站点内容

搜索文章、标签、分类

热搜 教程 主题