AI 應用新聞

AWS 與 NVIDIA 將為代理型與物理 AI 新增部署 200 萬顆 GPU

因應持續攀升的客戶需求,雙方深化 AI 技術堆疊各層面的整合,

將 NVIDIA Vera CPU、先進網路技術、Nemotron 開放式模型與物理 AI 技術導入 AWS

Amazon.com, Inc. 旗下 Amazon Web Services(AWS)與 NVIDIA 今日宣布大幅擴展雙方策略合作,以因應全球對於人工智慧(AI)基礎設施持續加速增長的需求。隨著客戶快速採用 AWS 上的 NVIDIA 加速運算,雙方計畫在 AWS 全球基礎設施中新增部署 200 萬顆 NVIDIA GPU,並進一步深化 AI 工廠、CPU、網路、開放式模型、資料處理與機器人領域的合作,共同打造協同設計的 AI 解決方案,讓客戶能以前所未有的規模加速 AI 開發與部署。

nvidia08271.jpg


AI 工作負載正快速擴展,涵蓋模型訓練與執行,以及資料處理、建立索引並用於驅動智慧應用程式等各個環節。客戶正從試點階段邁向正式部署,並擴大代理型 AI、科學探索、企業自動化與機器人等領域擴展工作負載。這些客戶需要更多元的模型選擇、更快速的資料管道,以及支援物理 AI 等新興使用情境的全新能力,同時也需要確保底層基礎設施能與自身創新同步發展,並為關鍵任務工作負載維持最高等級的安全性與可靠性。

為因應前沿 AI 實驗室、全球企業、新創公司與政府機構快速成長的需求,AWS 與 NVIDIA 將延續 16 年的共同創新基礎,擴充 AI 運算容量,並更快將共同設計的新型解決方案提供給客戶。作為擴大合作的一部分,雙方正致力於:
  • 於 2027 至 2028 年間,在 AWS 全球基礎設施中新增部署 200 萬顆 NVIDIA GPU
  • 將以 NVIDIA Vera CPU 為基礎的基礎設施導入 AWS
  • 以 NVIDIA 客製化高頻寬記憶體(NVHBM)擴展 NVIDIA NVLink Fusion™
  • 為美國政府打造 AI 工廠,包括在安全的 AWS基礎設施上部署 10 萬顆 GPU,以執行聯邦政府與國家安全工作負載
  • 將 NVIDIA 平台與 AWS Nitro System 及 Elastic Fabric Adapter(EFA)整合,強化安全性與可靠性
  • 持續在 Amazon Bedrock 與 Amazon SageMaker 上支援 NVIDIA Nemotron™ 開放式模型,為客戶提供更多開放式模型選擇
  • 運用 NVIDIA cuDF 與 cuVS CUDA-X™ 函式庫,加速 Amazon EMR 與 Amazon OpenSearch 上的資料處理與向量索引,實現更快速、更具成本效益的分析與 AI 應用
  • 透過 Amazon Robotics 採用 NVIDIA 物理 AI 平台,進一步推動機器人工作負載,加速倉儲自動化與新一代機器人的創新

AWS 執行長 Matt Garman 表示:「客戶希望能自由選擇最適合其 AI 工作負載的工具,也希望確信所有技術都能彼此無縫協作。這正是我們與 NVIDIA 深度合作,致力讓 AWS 成為執行 NVIDIA AI 技術最佳平台的原因,我們從網路、安全到部署,全方位最佳化基礎設施效能。此次擴大合作,將讓前沿實驗室、企業與政府機構有更多在 AWS 上建置與部署 AI 的管道。」

NVIDIA 創辦人暨執行長黃仁勳表示:「NVIDIA 與 AWS 共同打造了 AI 時代最強勁的成長引擎之一,而市場需求更遠超所有預測。過去 16 年來,我們攜手將 NVIDIA 的運算能力擴展至雲端。如今,我們正將合作擴展至全端堆疊,包括 GPU、CPU、網路、開放式模型與軟體,以只有 AWS 與 NVIDIA 能實現的空前速度與規模,推動代理型 AI 與物理 AI 落地。此次擴大合作,亦反映出客戶對 AWS 上 NVIDIA 平台的需求。」


大規模擴充 AI 運算能力

AWS 提供雲端服務供應商中最廣泛的 GPU 執行個體類型,可支援多元 AI 與機器學習工作負載。NVIDIA GTC 2026 大會上,AWS 宣布計畫自 2026 年起新增超過 100 萬顆 NVIDIA GPU。此後,需求已超出原先預期。AWS 計畫於 2027 至 2028 年間,在 AWS 全球基礎設施(包括 AI 工廠)中新增部署 200 萬顆 NVIDIA Blackwell Ultra、Rubin 與 Rubin Ultra GPU。新增的運算能力將協助驅動客戶的各項工作負載,涵蓋代理型 AI、科學探索、企業自動化到物理 AI 等。此外,AWS 也將擴充 NVIDIA Blackwell 容量,包括為 Amazon EC2 G7 執行個體 導入 NVIDIA RTX PRO™ 4500 Blackwell 伺服器版本 GPU。相較上一代 G6 執行個體,G7 的 AI 推論效能可達 4.6 倍,圖形效能可達 2.1 倍。AWS 是首家提供由 RTX PRO 4500 加速之運算執行個體的主要雲端服務供應商。AWS 與 NVIDIA 也正合作導入 NVIDIA Spectrum™ 網路技術,進一步最佳化 GPU 叢集中大規模 AI 訓練工作負載的網路效能。


AWS 對 NVIDIA Vera CPU 的支援

AWS 與 NVIDIA 正合作將基於 Vera CPU 的基礎設施導入 AWS,為需要兼具高效能 CPU 運算與加速運算基礎設施的代理型 AI 工作負載提供另一項選擇。Vera 專為新一代 AI 打造,與 AWS 提供最廣泛運算選擇的策略相輔相成,選項涵蓋 AWS 客製化晶片,以及合作夥伴最新的加速器與 CPU。


使用 NVIDIA NVLink Fusion 與 NVHBM 的異質 AI 基礎設施

在 re:Invent 2025 大會上,AWS 宣布將在下一代 Trainium 晶片支援 NVIDIA NVLink Fusion 高速晶片互連技術。NVIDIA 與 Amazon 旗下 Annapurna Labs 正進一步擴展此支援,攜手記憶體供應商導入 NVIDIA 全新客製化高頻寬記憶體(NVHBM)技術,讓 Trainium 得以採用速度更快、能源效率更高的記憶體。結合 NVLink Fusion 技術後,Annapurna Labs 即可運用 NVIDIA 客製化記憶體技術與垂直擴展架構,在提升 AI 工作負載效能與效率的同時,將 Trainium 與 GPU 無縫整合於共通的機架級架構。


以最高等級安全性驅動美國聯邦 AI

政府機構需要安全的 AI 基礎設施,以因應國家安全的需求。AWS 與 NVIDIA 計畫為美國政府打造 AI 工廠,導入 NVIDIA 的 AI 技術堆疊,其中包括計畫在 AWS 安全基礎設施上部署 10 萬顆 GPU,以執行聯邦政府與國家安全工作負載。此次合作讓 AWS 與 NVIDIA 位居推進美國聯邦政府國家安全 AI 發展的核心,使政府機構能針對 Impact Level 6(IL6)及以上等級的工作負載,大規模部署 AI。


這些新的承諾奠基於 AWS 與 NVIDIA 深度技術整合的基礎之上,而這些整合目前已為客戶帶來實際成果,包括:
  • 透過 AWS Nitro System 與 EFA 強化安全性與可靠性:此次擴大合作中,所有採用NVIDIA GPU 與Trainium 晶片的 EC2 執行個體,包括運用NVLink Fusion 的執行個體,皆建置於 AWS Nitro System 之上,並透過 EFA 互連。無論是 GPU 加速或採用 Trainium 晶片的 EC2 執行個體,未來也將持續建置於 Nitro System,並透過 EFA 進行水平擴展。Nitro 與 EFA 的結合有助確保 AWS 在擴充 NVIDIA GPU 規模並整合新互連技術時,客戶仍能維持其大規模正式環境 AI 工作負載所依賴的安全性、可靠性與網路效能。
  • AWS 上的 NVIDIA Nemotron 模型:作為 AWS 致力於提供最廣泛 AI 模型選擇承諾的一部分,NVIDIA Nemotron 系列開放式模型現已透過 Amazon Bedrock 以完全託管、無伺服器模型的形式提供。同時,對於希望在自有基礎設施上進行部署和微調的客戶,亦可透過 Amazon SageMaker 取得這些模型。這樣的整合讓客戶得以使用 NVIDIA 最新的開放式模型,同時運用 AWS 的安全性、可擴展性與營運工具。
  • GPU 加速資料處理與向量索引:隨著資料量成長,特徵工程、大規模 ETL 與即時分析等工作負載需要更快的處理速度。AWS 與 NVIDIA 正合作在 Amazon EMR 上透過 Amazon EC2 G7 執行個體與 NVIDIA cuDF 函式庫提供 GPU 加速的資料處理,相較基於 CPU 的配置,處理速度最高可提升 3.7 倍,且性價比提升 30%。而隨著 AI 應用、檢索增強生成流程與語意搜尋將向量資料庫規模推升至數十億筆紀錄的規模,索引建立與調校也成為瓶頸。Amazon OpenSearch Service 上的 GPU 加速向量索引,可將索引建立作業卸載至專用 GPU,以四分之一的成本實現最高 9 倍的向量索引速度,並可用於託管叢集與 Amazon OpenSearch Serverless。
  • 機器人領域的物理 AI:Amazon Robotics 正與 NVIDIA 合作,加速開發新一代機器人,整合 NVIDIA 全端堆疊物理 AI 平台,包括 NVIDIA Jetson™ 平台、NVIDIA Omniverse™ 函式庫與 NVIDIA Isaac™ 開放式機器人開發平台。合作範圍涵蓋模擬、合成資料生成、機器人訓練、路徑最佳化、功能安全與 Real-to-Sim 驗證,所有工作皆在 GPU 加速的 Amazon EC2 執行個體上執行。AWS 與 NVIDIA 共同推進機器人工作負載在大規模部署時所需要的能力,包括大規模模擬、多元訓練資料,以及持續的真實世界驗證。