
Liquid AI 于 2026 年 8 月 4 日发布 LFM2.5-2.6B,一个针对 agentic workload 训练、可以完全在设备上运行的 2.6B 参数模型。它的定位不是取代所有大型云端模型,而是让手机、CPU 或其他 edge device 可以处理 planning、tool calling 和多步骤任务。
这个方向的实际差异,在于 agent 不一定要每一步都调用 cloud API。Liquid AI 表示,本地模型可以降低延迟和资料外传风险,也不会按 token 产生云端推理费用。当模型足够小,团队可以在设备上并行处理后台任务,但真正部署仍要考虑电量、硬件安全、模型更新、工具权限和失败时的人工接管。
LFM2.5-2.6B 的 training pipeline 包括 supervised fine-tuning、teacher specialization、multi-domain on-policy distillation 和 agentic reinforcement learning。Liquid AI 表示,模型以约 34T tokens 预训练,并扩大 tokenizer 到 128K,同时加入 128K context extension,以应付长输入和 agent trace。最后的训练直接在 Hermes Agent、OpenClaw 等真实 harness 和 sandbox 内进行,让模型接触实际工具、system prompt 和互动模式。
官方比较涵盖 STEM、instruction following、tool use 和 agentic workflows。Liquid AI 表示,LFM2.5-2.6B 在 instruction-following benchmark 全部领先,在 tool-use benchmark 几乎全部领先,只在 BFCLv4 落后 Qwen3.5-9B;coding 任务则仍由较大型模型占优。这些结果来自发布方的模型比较和指定设定,应视为选型讯号,而不是跨硬件、量化方式和工作流的独立保证。
速度数字也反映它的目标场景:Liquid AI 在自己的测试中表示,模型在 M5 Max 上可达约 220 tokens per second,在 Ryzen AI Max+ 395 上约 113 tokens per second,内存使用低于 2.5GB,手机上则可维持约 30 tokens per second。这类数字高度依赖硬件、runtime、量化、prompt 长度和并发设定,部署前需要用自己的任务重跑。
整合方式相对直接。官方提供 Hugging Face 的 base 和 post-trained 权重,并建议先以 OpenAI-compatible endpoint 提供本地模型,再接入 Hermes Agent、OpenClaw 或 Pi 等 harness。这让既有 agent 系统可以保留工具接口,再把模型路由改到本地,但不代表所有 tool schema、长任务恢复和安全策略会自动适配。
LFM2.5-2.6B 的意义,是把 agent 选型由「最强模型」拉回「任务、延迟、私隐、成本和设备是否匹配」。对需要本地资料处理、离线能力或大量重复任务的场景,小模型可能比云端 frontier model 更容易长时间运行;对复杂 coding 和高难度推理,较大型模型仍可能更合适。最稳妥的做法是按任务分层,再为每层保留权限和人工 review。



