GenRouter 讓圖像 Agent 按需求選 workflow:複雜任務才使用重型推理

8 月 17 日的 GenRouter 預印本把多種 agentic image pipeline 統一成可路由的 workflow space,作者報告在自家測試中減少超過 95% execution cost 和 65% latency。

2026 年 8 月 17 日提交的 arXiv 預印本 GenRouter,處理一個很實際的 AI workflow 問題:圖像 Agent 不應該對每個 prompt 都跑同一條最重的 pipeline。現有系統通常各自建立 search、reasoning、verification 或多輪生成流程,結果是能力互相分散,簡單請求也被迫支付複雜流程的計算成本。

研究團隊提出 GenCanvas,把不同 agentic image pipeline 統一成一組 foundational primitives 和 executable templates;GenRouter 再根據 prompt 做 demand profiling、experience matching 和 Pareto filtering,選擇一個兼顧視覺品質、成本和 latency 的 workflow。這個設計把「模型生成甚麼」和「應該先做哪些步驟」分開,路由器本身成為可評估的決策層。

作者在五個 benchmark 的平均結果中報告,GenRouter 配合 GenCanvas 達到 71.3% 整體表現,與 GEMS 這類較重 pipeline 比較時,execution cost 由 59.70 美元降至 2.97 美元,latency 由 13.62 小時降至 4.68 小時。這些是論文作者自建實驗的數字,benchmark、模型、API 價格和執行環境都會影響結果,不應直接當成所有圖像服務的成本保證。

路由的核心不只是便宜。論文顯示,注重美感的 prompt 較常使用輕量的文字 enhancement workflow,而有複雜空間或邏輯限制的 prompt,才較常進入 reasoning、hybrid 或 verification 模板。對 workflow 設計來說,這是一個重要分工:昂貴的檢查和多輪修正應該按需求開啟,而不是預設套用。

研究亦測試了經驗累積。加入三個 benchmark 的 routing experience 後,混合測試集表現由 73.5 提升至 75.2,同時 cost 和 latency 分別下降 8.7% 和 7.9%。在另一個 zero-shot transfer 測試中,作者報告 frozen experience 已能比 standard LLM-as-Router 有更高表現和更低成本。這些結果仍屬預印本,需由其他團隊以不同模型和 prompt 分佈重現。

對實際內容 workflow,GenRouter 的啟示是先把任務分成簡單、受約束和高風險三類,再為每類設計最低可行步驟、可選 verifier、成本上限和人工 review。路由決策也要留下理由、使用的 template、重試次數和輸出品質,否則省下的 token 很快會被難以追查的失敗和人工返工抵消。

這篇研究把 agentic image generation 的競爭焦點由「單一模型有多強」推向「系統是否能按需求分配計算」。對 AI marketing、設計和內容團隊來說,可靠的 workflow 不等於每次都用最長推理;更合理的做法是讓複雜度、驗證和成本隨任務風險變化,並用 held-out prompts 驗證路由器沒有只記住 benchmark。

MODULE.002 //

更多 Insights

分享網站、AI automation、數碼營銷、AI news 和 VMTS 公司新聞。