Microsoft 把 AMD AI 基础设施带入 Azure:agent 协调成为 CPU 设计重点

Microsoft 于 7 月 20 日宣布把 AMD Helios 和新一代 EPYC 带入 Azure,推出面向数据处理、芯片设计、推理与 agent 协调的 HDv2、HXv2 和 ND MI455X v7。

Microsoft 于 2026 年 7 月 20 日宣布扩大 Azure 的 AI 和 HPC 基础设施,将 AMD 的 Helios AI platform 和新一代 EPYC 数据中心处理器带入三类即将推出的 Azure 方案。这次更新的核心信号是,agent 工作量开始被当成完整基础设施问题,而不只是 GPU 或模型问题。

第一类是 Azure HDv2,面向数据处理、搜索、强化学习和大规模 agent 协调。Microsoft 的规格描述包括接近 500 个第六代 AMD EPYC 实体 CPU 核心、4TB RAM、32TB 本地 NVMe 存储,以及 400Gb Azure Boost 网络。这些是官方公布的方案规格,实际可用型号、地区和价格仍要以 Azure 上线资料为准。

第二类是 Azure HXv2,定位是电子设计自动化和其他技术计算工作。Microsoft 表示 HXv2 会提供 176 个第六代 EPYC CPU 核心、超过 5GHz 的时钟、每核心多 50% 可寻址缓存,以及接近 2TB 或 4TB RAM 的 VM 大小;方案还包括 800Gb InfiniBand,用于大型 MPI 仿真和分布式内存工作。

第三类是 ND MI455X v7,使用 AMD Helios rack-scale solution,针对推理、搜索和 agentic workload。三类方案放在一起看,Azure 的设计不是用一种硬件处理所有 AI,而是把数据准备、芯片设计和生产级推理拆成不同的基础设施路径。

这个拆分对 agent 尤其重要。agent 执行任务时不只需要加速器,还需要 CPU 处理资料、准备上下文、管理工具、调度重试、传送结果和协调多个工作步骤。当 agent 从单次回答变成长时间服务,数据搬运、网络、内存和调度可能与模型推理一样成为瓶颈。

Microsoft 因此把“开放而异构的平台”放在公告前面。企业可以按工作流程在不同 CPU、GPU、内存和网络配置之间选择,而不是把所有工作都放到同一种加速器。这也意味着 agent 平台的成本模型会更复杂:数据准备、搜索、协调和推理需要分开观察,否则很难知道一个任务到底在哪一层消耗资源。

这次公告仍然是供应商对即将推出方案的描述,不等同于独立性能测试或所有地区已经正式可用。对采用者而言,真正需要验证的包括每项工作流程的端到端延迟、重试率、网络与存储成本,以及在不同硬件路径之间切换时的部署和治理负担。

MODULE.002 //

更多 Insights

分享网站、AI automation、数码营销、AI news 和 VMTS 公司新闻。