Qwen 3.6 27B 上 HN 头版:本地大模型终于到了”能打”的阶段

昨天,Hacker News 上出现了一篇引发大量讨论的文章:“Qwen 3.6 27B is the sweet spot for local development”,最终以 825 分、578 条评论登上 HN 首页。

这篇来自 Quesma 博客的文章核心观点很直接:作者 Piotr Migdał 测试了 Qwen 3.6 之后,认为它是第一个真正可以作为通用智能使用的本地模型

发生了什么

Qwen 3.6 是阿里巴巴通义千问在 6 月底发布的新系列,有两个版本:

  • Qwen 3.6 35B A3B:MoE(混合专家)架构,激活参数约 35B,速度快但质量稍低
  • Qwen 3.6 27B:稠密模型,速度更慢但能力更强

作者的结论是:27B 是值得推荐的版本。在 HN 评论里他补充了关键理由——35B A3B 虽然快 3 倍,但经常忽略他的指令要求(比如让它创建一个 npm 包,结果输出成了一个 index.html),而 27B 一次就做对了。

新信息:本地运行的硬数据

这是这篇文章最有价值的地方——作者直接给出了在真实硬件上的性能数据。

Apple M5 Max MacBook Pro(128GB 统一内存):

模型 量化方式 速度 内存占用
Qwen 3.6 35B A3B + MTP 8-bit 105 tok/s 45 GB
Qwen 3.6 27B + MTP 8-bit 32 tok/s 42 GB
DeepSeek-V4-Flash Q2-Q4 33 tok/s 103 GB

RTX 5090(用户评论补充):
Q6_K 量化 + Q4_0 KV @ 123k context,稳定 50 tok/s,显存占用约 28/32 GB。

核心数据点:32 tokens/秒,已经进入典型前沿模型 API 的响应速度范围。 作者在博客里写道:“30 tokens per second is not bad, well within typical frontier model API range”

深度分析:为什么这是一件大事

本地大模型从”能跑”到”能用”的临界点

过去本地模型的痛点很清晰:速度慢、质量差、占内存大、配置复杂。2024 年主流观点是”本地模型只适合玩一玩,生产环境还是用 API”。

Qwen 3.6 27B 正在改变这个判断:

速度层面:32 tok/s 对应的是 20~30 tokens/s 的首 token 延迟,这在很多场景下已经可以接受。不是所有任务都需要 GPT-4o 的即时响应。

质量层面:Artificial Analysis 的基准评分里,Qwen 3.6 27B 得分 37,作者的描述是”≈ mid 2025″,意味着它接近 GPT-4.5 / Claude Sonnet 4 级别模型的能力。这不是玩具模型能碰瓷的水平。

成本层面:文章里另一个被低估的信息是——DeepSeek-V4-Flash 需要 103 GB 内存才能跑到 33 tok/s,而 Qwen 3.6 27B 在 42 GB 就达到了相近速度。内存效率的差距,意味着硬件门槛的巨大差异。

llama.cpp 正在悄悄解决 AI 基础设施问题

作者在文章里明确推荐 llama.cpp 而不是 Ollama,原因很有意思:

“I would recommend against using that on ethical grounds.”

虽然这是调侃,但背后指向一个真实问题:Ollama 的封装虽然方便,但它是闭源的生态,且不是效率最优的方案。llama.cpp 作为底层推理引擎,在 Apple Silicon 上的效率比 mlx-lm 更高——作者测试里 llama.cpp 跑到了 95% GPU 利用率。

另一个重要信号:llama.cpp 对 Qwen 3.6 的支持已经包含了 MTP(Multi-Token Prediction,多 token 预测)加速,这是让 27B 速度从 18 tok/s 提升到 32 tok/s 的关键技术。

苹果 M 系列芯片的统一内存是意外赢家

文章里有一个被很多人忽略的细节:MacBook M5 Max 128GB 的统一内存架构,让它能以相对低的功耗跑 42GB 的模型。HN 评论里大量开发者讨论了”Mac Mini M4 + 远端部署”的工作流——本地 Mac Mini 跑模型,通过 Tailscale 远程调用。

这是 Nvidia 方案之外的另一条路。苹果的统一内存架构对于需要大显存但不需要高速 GPU 并行计算的场景,实际上很合适。

观点与讨论

这篇文章之所以引发关注,不是因为它介绍了一个新模型,而是因为它给了一个可操作的结论:花几千块买台 Mac Mini M4(64GB),配上 llama.cpp,你就能在本地跑一个能力接近 GPT-4.5 的模型。

这不是”完美替代云端”的故事,但它是成本和隐私权衡下,开始变得合理的替代方案

关键在于”工作流”变了:

  • 2023~2024:本地模型 = 玩具,API = 生产力工具
  • 2026:本地模型 = 部分场景的主力工具,API = 需要快速迭代或超长上下文时的补充

HN 评论里有一条被顶得很高的评论说:“Just buy a Mac Mini and put it in the other room”——这是开发者圈子里的主流建议,也是 Qwen 3.6 这类模型真正打开的场景。

结语

Qwen 3.6 27B 的意义不在于”阿里做出了一个好模型”,而在于它验证了一个趋势:开源本地模型的可用性,正在进入一个临界点

下一步的看点是:本地模型能否进一步降低硬件门槛,同时在工具调用(tool calling)和 agent 能力上追上专有模型?如果这两件事同时发生,AI 编程和 AI agent 的格局都会有新的变数。


本文相关平台:

  • Roogoo 虚拟卡:0开卡费、0年费、0额度费,USDT出入金,ChatGPT/Claude订阅必备。查看申请教程*
  • MiPay:免KYC消费USDT,OTC中文客服,出入金更灵活。了解 MiPay*
上一篇 130万个设备卖给了谁:AI 记录仪这个赛道,硬件公司反而笑到了最后
下一篇 Amazon 终于学聪明了:抄着 OpenAI 和 Anthropic 的路子,用 10 亿美元建了一个新部门

站点性能

运行正常
实时心跳0 ms
页面加载
0
SQL 查询
0
服务端响应
0 ms
峰值内存
0 MB

探索站点内容

搜索文章、标签、分类

热搜 教程 主题