开头
大模型推理有多贵?GPT-4 每千 token 的成本大约是几分钱,听起来不多,但当你的应用每天需要处理数百万 token 时,这个数字会迅速膨胀到令人窒息。H100 的租金是每小时 2-3 美元,中小企业用起来绑手绑脚。
Petals 给了一个完全不同的思路:为什么不把大模型的推理任务,像下载文件一样分发给成千上万个普通用户的 GPU?
这个项目今天冲上了 HN 头版,800+ upvote。它不是”更便宜的 API”,而是一套分布式推理协议——你的显卡不夠跑 Llama 3 70B?没关系,别人剩下的一半算力正好借给你用。
什么是 Petals
Petals 的核心逻辑和 BitTorrent 如出一辙:
- 传统的 LLM 推理:一个中心化服务器集群跑模型,所有用户请求都打到这几个节点上。贵,慢,还容易被限流。
- Petals:把大模型切成多个”层”(layers),不同用户的 GPU 分别承担其中一部分计算。请求像流水线一样流经多个节点,最终组装出完整的输出。
这意味着:一个人跑不起的 70B、405B 大模型,现在可以由几十、几百个普通用户的显卡协作运行。算力是碎片化的,但加在一起足以支撑足够大的模型。
技术上,Petals 做的是 张量并行(tensor parallelism)在拜占庭环境下的适配——也就是说,它允许参与者不诚实(可能返回错误结果),但整体仍然能给出正确输出。这比数据中心内部的高性能张量并行更难,因为节点之间的网络延迟和可靠性都是未知的。
为什么现在出现了
大模型推理成本一直是行业痛点。进入 2026 年,GPU 供给紧张、算力成本居高不下,而开源模型的尺寸却在持续膨胀——Llama 3 405B 级别的模型,单卡根本放不下,推理成本更是天文数字。
Petals 抓住了一个结构性机会:分布式消费级 GPU 的聚合算力其实相当可观。全球有 millions of GPUs in consumer machines,相当大比例处于空闲状态。这个项目的本质,是把这部分”沉没成本”变成一个可以用于 LLM 推理的弹性资源池。
类比一下:BitTorrent 能颠覆音乐电影的版权分发,是因为文件可以拆散、在无数节点之间流动,不需要任何一个中心服务器承受全部流量。Petals 在做的事,本质上是一样的——只是流动的是 LLM 的计算图,而不是视频文件。
新信息
1. 实际性能数据
根据 Petals 官方公布的基准测试:
– Llama 3 70B 在 Petals 网络上的推理速度约为 20-30 tokens/秒,这个速度对于日常对话和代码补全已经可用了。
– 对于更大的模型(如 BLOOM 176B),协作节点越多速度越快——理想情况下可以达到单用户单机根本跑不起来的规模。
作为对比:GPT-4 API 的标准响应速度大约是 40-60 tokens/秒,Petals 的速度虽然不及顶级商业模型,但对于开源大模型来说已经非常有竞争力,而且成本接近于零。
2. 隐私模型的新出口
Petals 特别适合运行那些因为太大、太贵而很难部署的隐私敏感模型。用户的请求不会流向任何商业服务器,数据完全在参与的节点之间流转。对于医疗、金融、法律等行业的 AI 应用,这是一个商业 API 无法替代的场景。
3. 参与门槛极低
普通用户只需要几行代码即可加入网络贡献算力,或者发起自己的推理请求:
from petals import AutoDistributedModelForCausalLM
model = AutoDistributedModelForCausalLM.from_pretrained("bigscience/bloom-176b")
outputs = model.generate(inputs)
官方提供 pip 安装、预训练模型对接,以及一套激励系统(token 经济学还在演进中)。
深度分析:为什么重要
大模型推理正在成为新的瓶颈。
训练大模型的门槛在下降——开源社区已经能在消费级硬件上训练出相当强的模型。但推理恰恰相反:模型的尺寸越大,对显存和算力的要求就越高,中小团队越难负担。
Petals 的思路本质上是把推理基础设施民主化。它不依赖于某个公司愿意以低价提供服务,也不依赖于政府或大厂的投资——它利用的是已经存在的、分散的、消费级的算力。这和 Web3 早期的某些设想异曲同工,但 Petals 没有发币、没有 token,是纯粹的 infra 项目。
这也呼应了一个更大的趋势:AI 推理正在从”集中式云服务”向”分布式边缘”演进。类似于 CDN 如何把内容分发从单一服务器推向全球边缘节点,Petals 正在把 LLM 推理从几个超级数据中心推向普通用户的客厅。
当然,挑战也很现实:
– 消费级 GPU 的稳定性远不如数据中心,节点随时可能掉线
– 协作推理的延迟取决于网络拓扑,优化空间很大但目前还不稳定
– 没有商业公司提供 SLA,服务质量完全依赖网络规模
这些问题随着网络扩大都会改善,但眼下 Petals 更适合开发者实验和隐私敏感场景,而不是要求 99.99% 可用性的生产环境。
观点与讨论
Petals 让我想到一个更大的问题:AI 时代的”算力平权”能实现吗?
OpenAI、Anthropic、Google 的护城河之一,就是他们能负担得起顶级算力,把最好的模型跑在最好的硬件上。中小企业和个人开发者只能通过 API 按调用付费,议价能力弱,且受制于平台方的政策(参见阿里封禁 Claude Code 事件)。
Petals 代表的分布式路线,理论上可以绕过这道壁垒。但它面临的核心挑战不是技术,而是协作激励机制——为什么用户要贡献自己的 GPU 算力?目前 Petals 的激励体系还不够成熟,如果只是靠”理想主义”和”社区精神”,规模效应很难出现。
不过换个角度想:BitTorrent 早期也没有成熟的激励机制,但它仍然改变了内容分发的规则,因为参与者的自私动机(下载速度更快)和系统的去中心化设计天然吻合。Petals 需要找到类似的”自私动机”,让贡献算力变成一件对自己有直接好处的事。
这个问题的答案,可能比 Petals 项目本身更重要。
结尾
Petals 的出现,标志着一个重要信号:LLM 推理不一定要依赖中心化的算力集群。分布式、消费级、协作式的推理路径正在变成现实。
它还不是 GPT-4 的替代品,但它在做的事情——让大模型推理像下载文件一样去中心化——在方向上是对的。
算力不应该只属于能买得起 H100 的人。这句话,Petals 正在试图证明。
本文相关平台:
Roogoo 虚拟卡:0开卡费、0年费、0额度费,USDT出入金,ChatGPT/Claude订阅必备。查看申请教程
MiPay:免KYC消费USDT,OTC中文客服,出入金更灵活。了解 MiPay