Liquid AI LFM2.5-2.6B:把 agent 工作流帶到手機與本地硬件

Liquid AI 發布 2.6B 參數的 LFM2.5-2.6B,主打在手機和 CPU 上本地執行 planning、tool calling 及多步驟 agent 工作,並提供 Hugging Face 權重。

Liquid AI 在 2026 年 8 月 4 日發布 LFM2.5-2.6B,一個針對 agentic workload 訓練、可以完全在裝置上運行的 2.6B 參數模型。它的定位不是取代所有大型雲端模型,而是讓手機、CPU 或其他 edge device 可以處理 planning、tool calling 和多步驟任務。

這個方向的實際差異,在於 agent 不一定要每一步都呼叫 cloud API。Liquid AI 表示,本地模型可以降低延遲和資料外傳風險,也不會按 token 產生雲端推理費用。當模型足夠細小,團隊可以在裝置上平行處理背景任務,但真正部署仍要考慮電量、硬件安全、模型更新、工具權限和失敗時的人工接管。

LFM2.5-2.6B 的 training pipeline 包括 supervised fine-tuning、teacher specialization、multi-domain on-policy distillation 和 agentic reinforcement learning。Liquid AI 表示,模型以約 34T tokens 預訓練,並擴大 tokenizer 到 128K,同時加入 128K context extension,以應付長輸入和 agent trace。最後的訓練直接在 Hermes Agent、OpenClaw 等真實 harness 和 sandbox 內進行,讓模型接觸實際工具、system prompt 和互動模式。

官方比較涵蓋 STEM、instruction following、tool use 和 agentic workflows。Liquid AI 表示,LFM2.5-2.6B 在 instruction-following benchmark 全部領先,在 tool-use benchmark 幾乎全部領先,只在 BFCLv4 落後 Qwen3.5-9B;coding 任務則仍由較大型模型佔優。這些結果來自發布方的模型比較和指定設定,應視為選型訊號,而不是跨硬件、量化方式和工作流的獨立保證。

速度數字也反映它的目標場景:Liquid AI 在自己的測試中表示,模型在 M5 Max 上可達約 220 tokens per second,在 Ryzen AI Max+ 395 上約 113 tokens per second,記憶體使用低於 2.5GB,手機上則可維持約 30 tokens per second。這類數字高度依賴硬件、runtime、量化、prompt 長度和並發設定,部署前需要用自己的任務重跑。

整合方式相對直接。官方提供 Hugging Face 的 base 和 post-trained 權重,並建議先以 OpenAI-compatible endpoint 提供本地模型,再接入 Hermes Agent、OpenClaw 或 Pi 等 harness。這讓既有 agent 系統可以保留工具接口,再把模型路由改到本地,但不代表所有 tool schema、長任務恢復和安全策略會自動適配。

LFM2.5-2.6B 的意義,是把 agent 選型由「最強模型」拉回「任務、延遲、私隱、成本和設備是否匹配」。對需要本地資料處理、離線能力或大量重複任務的場景,小模型可能比雲端 frontier model 更容易長時間運行;對複雜 coding 和高難度推理,較大型模型仍可能更合適。最穩妥的做法是按任務分層,再為每層保留權限和人工 review。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。