
NVIDIA 於 2026 年 9 月 4 日發表 Jetson 技術文章,主題是把原本需要 data center 的 reasoning 和 agentic AI 推到 edge。文章不是宣布一個新模型,而是展示如何選擇較小的 open model、做量化和 speculative decoding,再把 reasoning loop 放到接近 sensor、device logs 和實體系統的位置。
文章以兩個模型作比較:Nemotron 3.5 Lightning 是 30B total parameters 的 mixture-of-experts 模型,每個 token 只啟用 3B;Qwen3.8-27B 則是每個 token 都啟用 27B 的 dense model。NVIDIA 的判斷是,前者較適合 response-heavy、需要快回應的 agent,後者較適合較少但較難的決策。這不是單純的參數大小比較,而是把 architecture、memory use、生成速度和工作型態放在一起選。
Edge agent 的具體例子包括監察 live sensor data 和 device logs、採取已批准的 corrective action、用 predefined tests 驗證結果,以及只有在需要時才把例外升級給專家。這些動作若在本地完成,可以減少網絡依賴、降低 latency,亦可讓某些資料不必先送到 data center;但「在裝置上跑」並不自動等於已經有足夠的權限、更新和審計控制。
效能方面,NVIDIA 測試了 NVFP4 quantization 和 speculative decoding。NVFP4 以較低精度減少每次運算要搬移和處理的資料;speculative decoding 則由較小的 draft model 先提出多個 token,再由主模型一次驗證。官方圖表顯示,在 NVIDIA 的 Jetson 測試中,Qwen3.8-27B 使用 NVFP4 加 DFlash2 的 decode throughput 最高比 BF16 baseline 快 6.28 倍;Nemotron 3.5 Lightning 配合 DSpark 則達到 3.37 倍。
這些數字不能當成所有應用的固定倍率。NVIDIA 明確指出,最快的 speculative configuration 會因模型而不同,而且 throughput 會按 writing、reasoning、summarization 和 RAG workload 改變。文章的測試中,Nemotron 配 DSpark 約為 123.01 至 138.02 output tokens/s,Qwen 配 DFlash2 約為 27.69 至 34.44;真正部署前仍應使用自己的 prompt、tool calls 和 response patterns 重跑。
部署路徑以 Jetson AGX Thor 或 Jetson AGX Orin、JetPack 7.2、NVIDIA Container Runtime 和 vLLM 為例,也提到 llama.cpp 等框架。文章同時提醒,量化可能影響 accuracy;如有需要,要用 quantization-aware training 或 distillation 補回行為差異。公開 checkpoint、draft model 的 compatibility 和 token acceptance rate 亦會影響 speculative decoding 是否真的帶來好處。
對長時間運行的 Agent 來說,這次更新最實際的訊號是 inference layer 開始由「雲端模型 endpoint」變成「本地決策迴路」。本地化可以令機械人、車內助手、工業監測和偏遠環境更有韌性,但部署方要同時測試模型行為、工具權限、離線狀態、模型更新、日誌和失敗回復。速度提升只是入口,能否在錯誤時安全停下來,才是 edge agent 是否可用的分水嶺。



