
Microsoft 於 2026 年 7 月 20 日宣布擴大 Azure 的 AI 和 HPC 基礎設施,將 AMD 的 Helios AI platform 和新一代 EPYC 資料中心處理器帶入三類即將推出的 Azure 方案。這次更新的核心訊號,是 agent 工作量開始被當成完整基建問題,而不只是 GPU 或模型問題。
第一類是 Azure HDv2,面向資料處理、搜尋、強化學習和大規模 agent 協調。Microsoft 的規格描述包括接近 500 個第六代 AMD EPYC 實體 CPU 核心、4TB RAM、32TB 本地 NVMe 儲存,以及 400Gb Azure Boost 網絡。這些是官方公布的方案規格,實際可用型號、地區和價格仍要以 Azure 上線資料為準。
第二類是 Azure HXv2,定位是電子設計自動化和其他技術計算工作。Microsoft 表示 HXv2 會提供 176 個第六代 EPYC CPU 核心、超過 5GHz 的時脈、每核心多 50% 可尋址快取,以及接近 2TB 或 4TB RAM 的 VM 大小;方案亦包括 800Gb InfiniBand,用於大型 MPI 模擬和分佈式記憶體工作。
第三類是 ND MI455X v7,使用 AMD Helios rack-scale solution,針對推理、搜尋和 agentic workload。三類方案放在一起看,Azure 的設計不是用一種硬件處理所有 AI,而是把資料準備、晶片設計和生產級推理拆成不同的基礎設施路徑。
這個拆分對 agent 尤其重要。agent 執行任務時不只需要加速器,還需要 CPU 處理資料、準備上下文、管理工具、排程重試、傳送結果和協調多個工作步驟。當 agent 由單次回答變成長時間服務,資料搬運、網絡、記憶體和調度可能與模型推理一樣成為瓶頸。
Microsoft 因此把「開放而異構的平台」放在公告的前面。企業可以按工作流程在不同 CPU、GPU、記憶體和網絡配置之間選擇,而不是把所有工作都放到同一種加速器。這也意味著 agent 平台的成本模型會更複雜:資料準備、搜尋、協調和推理需要分開觀察,否則很難知道一個任務到底在哪一層消耗資源。
這次公告仍然是供應商對即將推出方案的描述,不等同於獨立性能測試或所有地區已經正式可用。對採用者而言,真正需要驗證的包括每項工作流程的端到端延遲、重試率、網絡和儲存成本,以及在不同硬件路徑之間切換時的部署和治理負擔。



