Liquid AI LFM2.5-2.6B:把 agent 工作流带到手机与本地硬件

Liquid AI 发布 2.6B 参数的 LFM2.5-2.6B,主打在手机和 CPU 上本地执行 planning、tool calling 及多步骤 agent 工作,并提供 Hugging Face 权重。

Liquid AI 于 2026 年 8 月 4 日发布 LFM2.5-2.6B,一个针对 agentic workload 训练、可以完全在设备上运行的 2.6B 参数模型。它的定位不是取代所有大型云端模型,而是让手机、CPU 或其他 edge device 可以处理 planning、tool calling 和多步骤任务。

这个方向的实际差异,在于 agent 不一定要每一步都调用 cloud API。Liquid AI 表示,本地模型可以降低延迟和资料外传风险,也不会按 token 产生云端推理费用。当模型足够小,团队可以在设备上并行处理后台任务,但真正部署仍要考虑电量、硬件安全、模型更新、工具权限和失败时的人工接管。

LFM2.5-2.6B 的 training pipeline 包括 supervised fine-tuning、teacher specialization、multi-domain on-policy distillation 和 agentic reinforcement learning。Liquid AI 表示,模型以约 34T tokens 预训练,并扩大 tokenizer 到 128K,同时加入 128K context extension,以应付长输入和 agent trace。最后的训练直接在 Hermes Agent、OpenClaw 等真实 harness 和 sandbox 内进行,让模型接触实际工具、system prompt 和互动模式。

官方比较涵盖 STEM、instruction following、tool use 和 agentic workflows。Liquid AI 表示,LFM2.5-2.6B 在 instruction-following benchmark 全部领先,在 tool-use benchmark 几乎全部领先,只在 BFCLv4 落后 Qwen3.5-9B;coding 任务则仍由较大型模型占优。这些结果来自发布方的模型比较和指定设定,应视为选型讯号,而不是跨硬件、量化方式和工作流的独立保证。

速度数字也反映它的目标场景:Liquid AI 在自己的测试中表示,模型在 M5 Max 上可达约 220 tokens per second,在 Ryzen AI Max+ 395 上约 113 tokens per second,内存使用低于 2.5GB,手机上则可维持约 30 tokens per second。这类数字高度依赖硬件、runtime、量化、prompt 长度和并发设定,部署前需要用自己的任务重跑。

整合方式相对直接。官方提供 Hugging Face 的 base 和 post-trained 权重,并建议先以 OpenAI-compatible endpoint 提供本地模型,再接入 Hermes Agent、OpenClaw 或 Pi 等 harness。这让既有 agent 系统可以保留工具接口,再把模型路由改到本地,但不代表所有 tool schema、长任务恢复和安全策略会自动适配。

LFM2.5-2.6B 的意义,是把 agent 选型由「最强模型」拉回「任务、延迟、私隐、成本和设备是否匹配」。对需要本地资料处理、离线能力或大量重复任务的场景,小模型可能比云端 frontier model 更容易长时间运行;对复杂 coding 和高难度推理,较大型模型仍可能更合适。最稳妥的做法是按任务分层,再为每层保留权限和人工 review。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。