LiquidAI 发布 LFM2.5-2.6B:小身材大能量,端侧 AI Agent 的新选择

AI Agent 正在从云端走向设备端。隐私保护、离线可用、无服务器账单——这些需求推动着端侧 AI 的快速发展。然而在手机、笔记本这样的日常硬件上部署 capable AI Agent,长期以来意味着对能力的巨大妥协。LiquidAI 最新发布的 LFM2.5-2.6B 正在改变这一现状。

2026 年 8 月 4 日,LiquidAI 在 Hugging Face 官方博客发布了 LFM2.5-2.6B 模型。这是一款参数规模仅为 26 亿的小型语言模型,专为在边缘设备上完全本地运行 AI Agent 设计。它支持工具调用和多步骤工作流,内存占用不到 2.5 GB,在 Apple M5 Max 上可达 220 tokens/秒的推理速度——让在手机上运行真正 capable 的 AI Agent 成为现实。

为什么端侧 Agent 很重要

在设备上本地运行 AI Agent 相比云端方案有三条核心优势:隐私——敏感数据不必离开设备;成本——无需为每次 API 调用付费;可用性——没有网络连接时依然可用。

传统上,小模型在复杂推理任务上表现不佳,限制了端侧 Agent 的实用价值。LFM2.5-2.6B 试图通过更高效的结构和针对性训练,在保持小尺寸的同时提供足够的任务能力。

技术架构与训练

LFM2.5-2.6B 基于 LiquidAI 自研的 LFM(Liquid Foundation Model)架构,预训练 token 数量约 34 万亿(~34T tokens),中期训练(mid-training)阶段将上下文窗口扩展至 128K。

将基础模型转化为可用 Agent 经历了四个后训练阶段:

第一阶段:监督微调(SFT)——进行两轮 SFT,训练数据 heavily weighted toward agentic 数据,包括工具调用、Web 搜索和 Agent 框架轨迹。

第二阶段:教师专业化(Teacher Specialization)——为数学、代码、工具调用等多个领域各训练一个专业教师模型。

第三阶段:多领域在线策略蒸馏(MOPD)——将各专业教师的知识蒸馏合并到单一学生模型中。

第四阶段:Agentic 强化学习(Agentic RL)——在真实 Agent 框架内运行多轮 RL,让模型在多样化工具、系统提示词和多轮任务环境中学会协作。

Agentic RL 管线将模型优化、推理和环境执行分离为三个独立组件。训练引擎(Training Engine)负责优化模型, rollout 引擎(Rollout Engine)用最新策略生成动作,RL 框架则协调 rollouts 收集、奖励计算和模型更新的完整循环。动作在沙箱服务(Sandbox Service)中执行,Blackbox Harness 承载 Agent 本身(如 OpenClaw 或 Hermes Agent),通过 Harness Proxy 将 Agent 框架视为黑盒,在不修改框架的前提下透明捕获 token 级轨迹,用于重建和验证 RL 训练样本。

基准测试表现

LFM2.5-2.6B 与参数量 4 倍以上的大模型进行了对比评测,覆盖 STEM、指令遵循、工具使用和 Agent 任务四个维度:

基准 LFM2.5-2.6B (2.6B) gemma-4-E2B-it (5.1B) gemma-4-E4B-it (8B) Qwen3.5-4B (4.7B) Qwen3.5-9B (9.7B)
AIME25 51.87 26.33 34.27 49.33 56.07
LiveCodeBenchv6 59.41 54.92 63.77 60.85 69.86
IFBench 59.17 34.08 39.24 48.40 56.47
Multi-IF 80.07 69.44 77.35 55.67 62.55
IFStruct 85.49 64.85 76.65 36.25 78.50
BFCLv4 56.88 36.98 46.39 50.56 60.13
ToolSandmark 77.83 52.40 65.00 75.55 76.44
Claw-Eval avg (EN) 62.85 53.14 58.02 62.28 66.53
PinchBench 68.22 44.24 55.09 71.26 71.45
BrowseComp+ (OpenClaw) 26.89 8.31 15.90 24.46 27.23

(注:加粗数字为同列最优成绩)

在指令遵循方面,LFM2.5-2.6B 在所有参测模型中排名第一,每个基准都领先于更大参数量的竞争对手。在工具使用方面,LFM2.5-2.6B 在 Multi-IF、IFStruct 和 ToolSandmark 上均为最优,仅在 BFCLv4 上以微弱差距落后于 9.7B 的 Qwen3.5-9B。Agent 任务方面,LFM2.5-2.6B 超越了两个 Gemma 模型,与 Qwen 系列基本持平。在知识记忆类任务上同样处于领先阵营,数学能力与 Qwen3.5-4B 接近。唯一明显短板是代码任务——较大的模型在编程相关基准上仍保持优势。

推理速度

LFM2.5-2.6B 在主流推理生态中提供 day-one 支持,包括 llama.cpp、MLX、vLLM、SGLang 和 ONNX。

CPU 推理:由于 LFM 架构的高效性,LFM2.5-2.6B 在参测模型中速度最快。Apple M5 Max 上达到 220 tokens/秒,AMD Ryzen AI Max+ 395 上为 113 tokens/秒。即使低至 30 tokens/秒,也足以在手机上运行 capable 的 Agent。

GPU 推理:在同尺寸级别中同样最快,高并发下接近 15K output tokens/秒,单卡 H100 每日可处理约 13 亿 tokens。

应用场景与局限性

LFM2.5-2.6B 的定位是需要数据留本地、无网可用、不想付云账单的场景。隐私敏感型任务(如个人日程管理、本地文档处理)、离线移动应用、资源受限的企业内网部署都是合适的使用环境。

不过需要客观看待它的局限:代码能力仍是较大模型的主场;对于极度复杂的多步推理任务,2.6B 参数的容量上限依然存在;工具调用的准确性也仍受模型规模制约。

端侧 Agent 的趋势信号

LFM2.5-2.6B 的发布是端侧 AI Agent 赛道的一个缩影。2026 年下半年以来,小型化、高效化的趋势愈发明显:Meta 同期推出 Muse Code 布局 AI 编程 Agent,LiquidAI 则专注于端侧推理效率的极致优化。

随着这类高效小模型逐步落地,未来在手机上运行真正 capable 的 AI Agent——帮你管理日程、处理本地文件、跨应用协作——将不再是概念演示,而是每个人口袋里的日常工具。


本文信息来源:Hugging Face 官方博客(LFM2.5-2.6B 技术解读,2026-08-04)及 TechCrunch(Meta Muse Code 报道,2026-08-05)。关键数字、模型参数及基准数据均来自上述来源。

上一篇 《舔狗养实录(师生1v1)》——山大附中十班的逆袭,一本让我哭湿枕头的校园群像
下一篇 GitHub Copilot 应用新增斜杠命令:一文读懂常用操作与使用技巧

站点性能

运行正常
实时心跳0 ms
页面加载
0
SQL 查询
0
服务端响应
0 ms
峰值内存
0 MB

探索站点内容

搜索文章、标签、分类

热搜 教程 主题