AI Agent 正在从云端走向设备端。隐私保护、离线可用、无服务器账单——这些需求推动着端侧 AI 的快速发展。然而在手机、笔记本这样的日常硬件上部署 capable AI Agent,长期以来意味着对能力的巨大妥协。LiquidAI 最新发布的 LFM2.5-2.6B 正在改变这一现状。
2026 年 8 月 4 日,LiquidAI 在 Hugging Face 官方博客发布了 LFM2.5-2.6B 模型。这是一款参数规模仅为 26 亿的小型语言模型,专为在边缘设备上完全本地运行 AI Agent 设计。它支持工具调用和多步骤工作流,内存占用不到 2.5 GB,在 Apple M5 Max 上可达 220 tokens/秒的推理速度——让在手机上运行真正 capable 的 AI Agent 成为现实。
为什么端侧 Agent 很重要
在设备上本地运行 AI Agent 相比云端方案有三条核心优势:隐私——敏感数据不必离开设备;成本——无需为每次 API 调用付费;可用性——没有网络连接时依然可用。
传统上,小模型在复杂推理任务上表现不佳,限制了端侧 Agent 的实用价值。LFM2.5-2.6B 试图通过更高效的结构和针对性训练,在保持小尺寸的同时提供足够的任务能力。
技术架构与训练
LFM2.5-2.6B 基于 LiquidAI 自研的 LFM(Liquid Foundation Model)架构,预训练 token 数量约 34 万亿(~34T tokens),中期训练(mid-training)阶段将上下文窗口扩展至 128K。
将基础模型转化为可用 Agent 经历了四个后训练阶段:
第一阶段:监督微调(SFT)——进行两轮 SFT,训练数据 heavily weighted toward agentic 数据,包括工具调用、Web 搜索和 Agent 框架轨迹。
第二阶段:教师专业化(Teacher Specialization)——为数学、代码、工具调用等多个领域各训练一个专业教师模型。
第三阶段:多领域在线策略蒸馏(MOPD)——将各专业教师的知识蒸馏合并到单一学生模型中。
第四阶段:Agentic 强化学习(Agentic RL)——在真实 Agent 框架内运行多轮 RL,让模型在多样化工具、系统提示词和多轮任务环境中学会协作。
Agentic RL 管线将模型优化、推理和环境执行分离为三个独立组件。训练引擎(Training Engine)负责优化模型, rollout 引擎(Rollout Engine)用最新策略生成动作,RL 框架则协调 rollouts 收集、奖励计算和模型更新的完整循环。动作在沙箱服务(Sandbox Service)中执行,Blackbox Harness 承载 Agent 本身(如 OpenClaw 或 Hermes Agent),通过 Harness Proxy 将 Agent 框架视为黑盒,在不修改框架的前提下透明捕获 token 级轨迹,用于重建和验证 RL 训练样本。
基准测试表现
LFM2.5-2.6B 与参数量 4 倍以上的大模型进行了对比评测,覆盖 STEM、指令遵循、工具使用和 Agent 任务四个维度:
| 基准 | LFM2.5-2.6B (2.6B) | gemma-4-E2B-it (5.1B) | gemma-4-E4B-it (8B) | Qwen3.5-4B (4.7B) | Qwen3.5-9B (9.7B) |
|---|---|---|---|---|---|
| AIME25 | 51.87 | 26.33 | 34.27 | 49.33 | 56.07 |
| LiveCodeBenchv6 | 59.41 | 54.92 | 63.77 | 60.85 | 69.86 |
| IFBench | 59.17 | 34.08 | 39.24 | 48.40 | 56.47 |
| Multi-IF | 80.07 | 69.44 | 77.35 | 55.67 | 62.55 |
| IFStruct | 85.49 | 64.85 | 76.65 | 36.25 | 78.50 |
| BFCLv4 | 56.88 | 36.98 | 46.39 | 50.56 | 60.13 |
| ToolSandmark | 77.83 | 52.40 | 65.00 | 75.55 | 76.44 |
| Claw-Eval avg (EN) | 62.85 | 53.14 | 58.02 | 62.28 | 66.53 |
| PinchBench | 68.22 | 44.24 | 55.09 | 71.26 | 71.45 |
| BrowseComp+ (OpenClaw) | 26.89 | 8.31 | 15.90 | 24.46 | 27.23 |
(注:加粗数字为同列最优成绩)
在指令遵循方面,LFM2.5-2.6B 在所有参测模型中排名第一,每个基准都领先于更大参数量的竞争对手。在工具使用方面,LFM2.5-2.6B 在 Multi-IF、IFStruct 和 ToolSandmark 上均为最优,仅在 BFCLv4 上以微弱差距落后于 9.7B 的 Qwen3.5-9B。Agent 任务方面,LFM2.5-2.6B 超越了两个 Gemma 模型,与 Qwen 系列基本持平。在知识记忆类任务上同样处于领先阵营,数学能力与 Qwen3.5-4B 接近。唯一明显短板是代码任务——较大的模型在编程相关基准上仍保持优势。
推理速度
LFM2.5-2.6B 在主流推理生态中提供 day-one 支持,包括 llama.cpp、MLX、vLLM、SGLang 和 ONNX。
CPU 推理:由于 LFM 架构的高效性,LFM2.5-2.6B 在参测模型中速度最快。Apple M5 Max 上达到 220 tokens/秒,AMD Ryzen AI Max+ 395 上为 113 tokens/秒。即使低至 30 tokens/秒,也足以在手机上运行 capable 的 Agent。
GPU 推理:在同尺寸级别中同样最快,高并发下接近 15K output tokens/秒,单卡 H100 每日可处理约 13 亿 tokens。
应用场景与局限性
LFM2.5-2.6B 的定位是需要数据留本地、无网可用、不想付云账单的场景。隐私敏感型任务(如个人日程管理、本地文档处理)、离线移动应用、资源受限的企业内网部署都是合适的使用环境。
不过需要客观看待它的局限:代码能力仍是较大模型的主场;对于极度复杂的多步推理任务,2.6B 参数的容量上限依然存在;工具调用的准确性也仍受模型规模制约。
端侧 Agent 的趋势信号
LFM2.5-2.6B 的发布是端侧 AI Agent 赛道的一个缩影。2026 年下半年以来,小型化、高效化的趋势愈发明显:Meta 同期推出 Muse Code 布局 AI 编程 Agent,LiquidAI 则专注于端侧推理效率的极致优化。
随着这类高效小模型逐步落地,未来在手机上运行真正 capable 的 AI Agent——帮你管理日程、处理本地文件、跨应用协作——将不再是概念演示,而是每个人口袋里的日常工具。
本文信息来源:Hugging Face 官方博客(LFM2.5-2.6B 技术解读,2026-08-04)及 TechCrunch(Meta Muse Code 报道,2026-08-05)。关键数字、模型参数及基准数据均来自上述来源。