- 在 Artificial Analysis 基準測試中,Groq 3 LPX 在代理型程式設計及其他對延遲敏感的工作負載上,展現世界級速度。
- NVIDIA Groq 3 LPX 透過大幅提升詞元生成速率,進一步擴展 NVIDIA Vera Rubin NVL72 系統的推論效能。
- Nebius 成為首家採用 NVIDIA Groq 3 LPX 的 AI 雲端服務供應商。
代理系統可能會在數百或數千個推論步驟中產生大量詞元,因此更快的詞元生成速度對於代理而言至關重要,使其得以即時進行推理、採取行動並完成複雜任務。
Vera Rubin NVL72 系統為各類 AI 工廠提供最靈活的訓練與推論平台。NVIDIA Groq 3 LPX 藉由大幅提高詞元生成速率,進一步提升 Vera Rubin NVL72 的推論效能,並針對需要處理大量情境的工作負載提供頂級使用者體驗,讓代理能以極致速度執行任務。
NVIDIA Groq 3 LPX 正不斷拓展 AI 推論的前沿。在執行開源代理型模型 Gemma 4 31B 的 Artificial Analysis 基準測試中,Groq 3 LPX 在對 AI 代理系統至關重要的 10 萬詞元情境下,達到每秒輸出 3,400 個詞元,創下該模型歷來最快的效能紀錄。
Groq 3 LPX 能將原本需要數小時的程式設計等代理任務縮短至數分鐘完成,針對 AI 代理與對延遲高度敏感的工作負載,其回應速度較最接近的替代平台快達 4 倍。
NVIDIA 創辦人暨執行長黃仁勳表示:「推論是 AI 的成長引擎。NVIDIA Grace Blackwell 與 NVL72 以前所未有的效能與效率躍進,徹底革新大型語言模型推論。Vera Rubin透過專為代理型 AI 時代設計、針對工作負載進行最佳化的 AI 工廠配置,拓展了這項願景,並藉由 LPX 的超高速詞元生成進一步推進效能前沿。這將改變智慧的產生方式,在全球 AI 運算需求加速成長之際,再次大幅提升 AI 的輸送量、效率與回應速度。」
Groq 3 LPX:互動式 AI 推論加速器
代理型 AI 帶來兩項截然不同的運算挑戰:高效率處理龐大的情境資訊,以及需要以極低延遲生成詞元。
NVIDIA Groq 3 LPX 專為提升 Vera Rubin 的互動性(interactivity)而打造。互動性是指為單一使用者生成詞元的速率,並可決定代理完成各個工作步驟的速度
更快的生成速度能讓 AI 代理有更多時間檢查檔案、撰寫與測試程式碼、呼叫工具、驗證結果並持續進行迭代,同時維持流暢的使用者體驗。
Groq 3 LPX 加速拓展 AI 雲端市場
AI 雲端正逐漸成為推動 AI 經濟發展的引擎,讓企業與開發人員能夠運用先進的基礎設施,進行大規模的訓練、推理與推論。對於服務大量、且對延遲高度敏感之推論工作負載的供應商而言,NVIDIA Groq 3 LPX 提供一條能在經過驗證的機架級系統中部署差異化運算能力的途徑。
領先的 AI 雲端服務供應商 Nebius 計畫將 NVIDIA Groq 3 LPX 導入其生產級推論平台 Nebius Token Factory,讓開發人員得以運用極致的詞元生成速度,打造反應極為靈敏的 AI 代理應用。
Nebius 技術長 Danila Shtan 表示:「生成階段決定了 AI 系統在推論過程的實際回應速度,而 NVIDIA Groq 3 LPX 正是專為加速此階段而打造。作為首個透過 Nebius Token Factory 將其投入生產環境的 AI 雲端,我們致力於讓代理每個循環步驟都能即時完成,同時透過開發者目前已使用的 API,無需遷移至新的技術堆疊。」
繼 Nebius 之後,專為 AI 推論打造的雲端 Groq 也計畫成為 NVIDIA Groq 3 LPX 的首批採用者之一。
專為 AI 工廠打造的極致協同設計
NVIDIA Vera Rubin 透過橫跨 7 款晶片與 5 種專用機架的極致協同設計,成為最全面的 AI 工廠平台。
NVIDIA Vera Rubin NVL72 與 Groq 3 LPX 能滿足客戶 AI 工廠的各類工作負載需求,包括前沿模型開發商與開放模型服務供應商。
這些機架平台搭載 NVIDIA BlueField®-4 DPU,並與 NVIDIA Vera CPU 機架、NVIDIA Vera BlueField-4 STX 儲存系統與 NVIDIA Spectrum™-6 SPX 乙太網路協同運作,用於最佳化多代理系統,同時實現最高的每瓦輸送量與最低延遲的推論效能。
