NVIDIA 推出 64GB DGX Spark:把大型模型与 AI 代理带到本地

NVIDIA 10 月 2 日宣布 64GB 统一内存版本的 DGX Spark,主打本地运行 100B 参数模型及代理;两台设备可通过 Sync 组成 128GB 的本地系统。

NVIDIA 于 2026 年 10 月 2 日公布 64GB 统一内存版本的 DGX Spark,将定位由个人 AI 开发机进一步推向本地模型和代理工作站。NVIDIA 表示,新配置可以在本地运行 100B 参数级模型,并在不依赖云端的情况下支持编程、研究和其他 agent workflow;合作厂商的产品由 10 月 23 日起推出,起价 4,999 美元。

DGX Spark 的重点不是单纯把一张显卡放进较小机箱,而是以 GB10、64GB 统一内存、DGX OS 和 NVIDIA 的软件堆栈,让模型、工具和代理可以在同一台本地设备上运行。对于包含敏感代码、内部文件或离线数据的工作,本地处理可以减少把数据送出网络的需要;但实际隐私仍取决于网络设置、日志、用户权限及安装的工具,不能只看「local」标签。

当单台设备的内存不足时,两台 DGX Spark 可以用 NVIDIA Sync Cluster Assistant 组成 128GB 的本地系统,官方称可处理最高约 200B 参数模型。NVIDIA 也表示,在自己的测试中,两台同步的 DGX Spark 运行 Qwen 3.8 27B 时最高可达单机的 1.7 倍表现。这是 NVIDIA 的硬件和软件测试结果,实际速度会受模型量化、网络、批次、并行方式及工作负载影响。

软件方面,设备预装或支持 NVIDIA Agent Toolkit、CUDA-X AI、Nemotron、Ollama、vLLM 和 PyTorch;Sync 会协助设置网络、软件版本和节点。NVIDIA 表示之后的 launcher 也会加入 Qwen 3.8 和 OpenCode。这种整合对本地代理很重要,因为用户不只要下载模型,还要处理推理服务器、工具权限、文件夹范围、任务状态和多台机器的协调。

官方列出的使用方式包括让编程或研究代理全天候运行、在本地电脑上处理应用推理,以及在工作量增加时由一台设备扩展至两台。对于希望避免云端成本或数据外流的团队,本地代理可以提供更直接的控制;代价是团队要自己负责硬件供应、更新、备份、监控、访问控制和故障处理。

DGX Spark 64GB 的信号,是 AI 代理的运行位置开始出现更清晰的本地选项:不是所有任务都要交给大型云端服务,也不是所有本地工作都能达到相同速度或模型规模。采用前应先测量实际上下文长度、并发量、模型量化、延迟和功耗,再决定哪些数据适合留在本地。涉及生产系统时,还要把本地环境当成需要更新和审计的服务,而不是一台买回来就自动安全的黑盒。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。