
NVIDIA 於 2026 年 9 月 4 日發布一篇 NemoClaw 技術文章,展示一個 memory-driven Chief of Staff agent。它不是單純把更多對話塞進 context,而是把日常訊息、決定、項目和待辦事項整理成一個會隨時間更新的 self model,讓代理在下一次工作時能夠延續過去的脈絡。
這個 self model 以 Markdown 儲存人、項目、優先次序、目標和工作模式等 derived knowledge;另一個 SQLite ledger 則記錄 obligations、ranking、corrections 和 audit events。NVIDIA 將兩者分開,目的是不要把「來源證據」和「代理判斷」混成同一種資料。當答案出錯時,開發者可以追查問題來自原始證據、記憶維護、retrieval,還是最後的模型決策。
文章把工作流概括成 Evidence → Knowledge → Governed execution。代理先從有限範圍的相關內容更新記憶,再用記憶作為推理輸入,最後由政策和 runtime 控制實際行動。這個邊界很關鍵:記憶可以告訴代理某位同事偏好用 Slack,但不可以因此自動取得傳訊息的 credential。Context 可以影響 action,但不能授權 action。
NVIDIA 的例子還加入 intent gate,讓與使用者已聲明優先事項相關的 obligation 排在短期 urgency 之前;tier 的數量、overflow 和排序則由 deterministic code 執行。使用者可以把一項待辦移到另一層或忽略它,變更會寫入 append-only audit trail;如果類似修正重複出現,系統可以更新一份仍然可讀、可編輯和可刪除的 preference policy。
NVIDIA 報告的 Agent Memory Benchmark 結果顯示,在兩個都使用 Nemotron 3 Ultra 的設定中,self model 在 186 條問題的 overall accuracy 由 agentic RAG baseline 的 82.8% 升至 90.9%,追蹤變更事實的五條問題由 60.0% 升至 100%。不過它也不是全面勝出:corpus-faithful answering 由 100% 降至 92.3%,single-hop lookup 由 86.7% 降至 83.3%。這些數字是 NVIDIA 文章和示範 repository 的結果,不能直接當作所有企業資料的 production SLA。
安全層由 NVIDIA OpenShell 提供,讓 agent 在 sandbox 內運行並限制 file system、process 和 network access;managed inference 及 MCP connection 所需的 credentials 保留在 sandbox 外。這種設計把「長期記憶」和「可採取行動」分開,避免一段被污染的記憶文字直接變成系統權限。
目前公開 recipe 仍是可檢查的 foundation,而不是已接入真實辦公室帳戶的完整產品。NVIDIA 說示範資料是 synthetic,offline walkthrough 不會發訊息或修改 source systems;live connector 仍要另行處理 credentials、privacy、retention 和 deletion。這個限制反而令架構更容易審閱,因為人可以先測試記憶、排序、修正和 policy path,再決定何時接入真實資料。
這次更新對 Agent workflow 的訊號,是長期記憶不應只是另一個 vector store。可靠的做法需要把 evidence、knowledge、judgment、user correction 和 governed action 分層,並保留可以追查的修改歷史。當代理開始替人處理跨日、跨工具的工作時,能否解釋「為何這樣排序」和「誰批准這個動作」,會比記住更多文字更重要。



