3B 参数打赢 DeepSeek V3.2:VibeThinker 重新定义了什么叫\”小模型\”

一个只有 3B 参数的模型,在数学推理测试上打败了一众千亿参数的旗舰模型。

这不是标题党——这是 6 月 15 日出现在 arXiv 上的技术报告,数据就在那里,数字不会骗人。

VibeThinker-3B 到底测出了什么

VibeThinker-3B 是一个紧凑的密集模型(dense model),来自一个叫 Sen Xu 的团队,8 位作者联合署名。核心方法叫 Spectrum-to-Signal post-training paradigm,简单说就是一套把模型压缩到极致还能保持推理能力的训练流程。

具体数字:

  • AIME26(美国数学邀请赛):94.3 分,加上 claim-level test-time scaling 可以到 97.1
  • LiveCodeBench v6:Pass@1 80.2
  • LeetCode 竞赛(未见过的题):96.1% acceptance rate
  • IFEval(指令遵循):93.4(说明没有为了推理能力牺牲指令控制)
  • 对比组是这些模型:

  • DeepSeek V3.2
  • GLM-5
  • Gemini 3 Pro
  • 都是千亿参数的怪物。VibeThinker-3B 的结论是:我和你们一个段位。


    论文原文:
    "VibeThinker-3B achieves frontier-level performance on highly demanding
    verifiable tasks, effectively placing it in the performance band of
    first-tier reasoning systems, matching or exceeding flagship models
    that are orders of magnitude larger."

    问题是:这个结论能信吗?

    值得认真看一下 AIME26 的含金量。

    AIME(American Invitational Mathematics Examination)是美国数学邀请赛,难度介于高中数学竞赛和奥数之间。AI 在这个测试上的进展,这两年是这么走的:

  • 2023 年:GPT-4 在 AIME 上大概 30~40 分
  • 2024 年:Claude 3.5 Sonnet 可以到 60~70
  • 2025 年:o3、DeepSeek V3.2 到了 85~90
  • 2026 年:VibeThinker-3B 到了 94.3
  • 94.3 意味着什么?意味着这套题它只错了一道。

    但我需要提醒一点:AIME 每年的题目难度有波动,不同模型评测时的 few-shot 数量和测试时方法(chain-of-thought、self-consistency 等)也不同。论文里用的是 claim-level test-time scaling——这是他们自己的方法,不一定和其他模型的评测条件完全等价。

    行业反应:HN 上 125 分,43 条评论

    VibeThinker 的 HN 帖子拿到了 125 分,是当天科技类最高分之一。评论区有意思的是,没有人在嘲笑这个研究——大家讨论的是这个”Spectrum-to-Signal paradigm”到底新在哪里,以及这个”Parametric Compression-Coverage Hypothesis”有没有道理。

    核心洞察:为什么会这样

    作者提出了一个假说叫 Parametric Compression-Coverage Hypothesis(参数压缩-覆盖假说),逻辑很清晰:

    > 可验证推理(数学、代码)是可以压缩进紧凑推理核的能力。开放域知识(常识、事实、长尾概念)才需要大参数覆盖。

    换句话说:数学推理更像是一种”算法”,算法可以用更少的参数学会;知识记忆才需要海量参数。

    这个假说如果成立,会带来几个推论:

    1. 大模型和小模型的分工正在被重新划定——通用知识靠大模型,专项推理任务靠小模型,效率差 10 倍
    2. 边缘部署 AI 的窗口在打开——以后手机、车载设备上的推理模型,不需要千亿参数也能做复杂推理
    3. 模型能力评测体系需要重建——只测 benchmark 分数不够,要测”参数效率”

    对行业的冲击

    我真正觉得有意思的地方在于:VibeThinker 证明了”Scaling Law 之外还有路”。

    这两年行业默认的路子是:模型要强,必须把参数堆大。但 VibeThinker 说,还有一条路是把训练方法做得更聪明,让压缩后的模型依然保持核心能力

    这和 Mistral 之前走的方向有点像——Mistral 7B 当年也是靠”小参数、高效率”打出了自己的生态位。但 VibeThinker 的突破在于,它的 benchmark 分数直接对标的是千亿级模型,而不只是”同参数量里最强”。

    对 AI 应用开发者的影响是具体的:以后选模型不一定非要用最大的。如果你的场景是数学推导、代码生成、逻辑验证这类”可验证推理”任务,一个 3B 的本地模型可能就够了。响应更快,成本更低,隐私更好。

    一点保留意见

    VibeThinker 目前还只是技术报告,没有经过独立复现。论文里的 benchmark 数字需要等社区验证。

    另外:LiveCodeBench 的 80.2 Pass@1 看起来很高,但 LiveCodeBench 是不断更新的题库,不同时间的题目难度有差异。VibeThinker 测的版本和其他模型的测试版本是否完全等价,需要确认。

    结论:方向是对的,数据是漂亮的,但路还要一步一步走。

    一句话总结:VibeThinker-3B 用 3B 参数做到了千亿参数模型的推理水平,如果这个路线被验证成立,AI 行业对”模型要多大才够用”的认知要被彻底改写。

    数据来源:arXiv:2606.16140,2026年6月15日提交;Hacker News,2026年6月23日 trending,125 points。


    本文相关平台:

    • Roogoo 虚拟卡:0开卡费、0年费、0额度费,USDT出入金,ChatGPT/Claude订阅必备。查看申请教程
    • MiPay:免KYC消费USDT,OTC中文客服,出入金更灵活。了解 MiPay
    上一篇 Apertus:欧盟血统的"全开源"AI模型,可能是开源运动最重要的一次升级
    下一篇 OpenAI 的 Codex 编程助手,正在悄悄吃掉你的硬盘

    站点性能

    运行正常
    实时心跳0 ms
    页面加载
    0
    SQL 查询
    0
    服务端响应
    0 ms
    峰值内存
    0 MB

    探索站点内容

    搜索文章、标签、分类

    热搜 教程 主题