單機架 NVIDIA Vera Rubin NVL72

NVIDIA Vera Rubin NVL72

打造代理 AI 的下一波尖端技術,現已全面投入生產。

概覽

七款新晶片與一部 AI 超級電腦

NVIDIA Vera Rubin NVL72 整合 NVIDIA 的尖端技術,包括 72 個 Rubin GPU、36 個 Vera CPU、NVIDIA ConnectX™-9 SuperNIC 與 BlueField™-4 DPU。這款電腦採用 NVIDIA NVLink™ 6 交換器,於一致性機架級平台垂直擴充智慧處理能力,並採用 NVIDIA Quantum-X800 InfiniBand 與 Spectrum-X™ 乙太網路橫向擴充,大規模推動 AI 產業革命。搭配 NVIDIA Groq 3 LPX 機架部署時,Vera Rubin NVL72 可為兆級參數模型與百萬 Token 上下文帶來全新境界的推論效能。

Vera Rubin NVL72 採用第三代 NVIDIA MGX™ NVL72 機架設計,可從前幾代產品無縫轉換。相較於 NVIDIA Blackwell,它僅需四分之一的 GPU 即可進行 AI 訓練,AI 推論的每百萬 Token 成本更降至十分之一。這款機架級 AI 超級電腦採用無纜線模組化托盤設計,並獲得逾 80 個 MGX 生態系合作夥伴支援,可快速部署,實現世界級效能。

NVIDIA Vera Rubin 全面量產,為全球代理 AI 工廠提供動力

NVIDIA Vera Rubin 正全面投入生產,台灣頂尖伺服器製造商與全球供應鏈領導者進行大規模製造並推出基於 Vera Rubin 的系統,藉此助力 AI 實驗室、雲端服務商與超大規模企業,打造未來的智慧。

日本政府、產業領導者與 NVIDIA 推出全球首個國家級 AI 基礎架構

NVIDIA 正與 Noetra Corp. 合作,推出一座配備 13,750 個 NVIDIA Vera CPU 和 27,500 個 NVIDIA Rubin GPU 的 NVIDIA Vera Rubin AI 工廠,支援國家級物理 AI 發展。

效能

AI 推論與訓練效率大幅提升

LLM 推論效能可能會有所變更。根據使用 32K/8K ISL/OSL 的 Kimi-K2 思考模型,比較 NVIDIA GB200 NVL72 與 NVIDIA Vera Rubin NVL72 每 100 萬個 Token 的成本。

降低推論成本

NVIDIA Vera Rubin NVL72 每百萬 Token 的成本僅為 NVIDIA GB200 NVL72 的十分之一,實現高度互動、深度推理的代理 AI。

將 AI 工廠傳輸量最大化

NVIDIA Vera Rubin NVL72 每兆瓦能提供高達十倍 NVIDIA GB200 NVL72 的 Token 數量,在相同的功耗下擴展智慧。

LLM 推論效能可能會有所變更。根據使用 32K/8K ISL/OSL 的 Kimi-K2 思考模型,比較 NVIDIA GB200 NVL72 與 NVIDIA Vera Rubin NVL72 的每秒每兆瓦 Token 數量。

此為預測效能,之後可能會有所變動。採用 10T MoE 模型的 GPU 數量,在 1 個月的固定時限內,使用 100T Token 進行訓練,比較 NVIDIA GB200 NVL72 與 NVIDIA Vera Rubin NVL72。

大幅提升訓練效率

NVIDIA Vera Rubin NVL72 訓練mixture-of-experts (MoE) 模型時,GPU 數量僅為 NVIDIA GB200 NVL72 的四分之一。

兆級參數模型的傳輸量提升 35 倍

代理系統消耗的 Token,最高可達傳統 AI 應用程式的 15 倍。AI 工廠必須以低延遲與高效的經濟效益,提供 Token 運算量以及處理海量的情境視窗。Vera Rubin NVL72 搭配 LPX 時,可為兆參數模型提供高達 35 倍的每兆瓦傳輸量。

此為預測效能,之後可能會有所變動。免費方案 ($0):Qwen-3 2350 億參數模型,支援 3.2 萬鍵值 (KV) 快取 Token。中階方案 ($3):Kimi K2.5 一兆參數模型,支援 12.8 萬鍵值 (KV) 快取 Token。高階方案 ($6):GPT-MoE 兩兆參數的模型,支援 12.8 萬鍵值 (KV) 快取 Token。頂級方案 ($45) 與超級方案 ($150) 方案:GPT-MoE 兩兆參數模型,支援 40 萬鍵值 (KV) 快取 Token。

推動 AI 代理程式時代

Vera Rubin 平台

Vera Rubin 平台以五款機架開啟代理 AI 的下一波浪潮,協助全球 AI 工廠擴展規模,包括 NVIDIA Vera Rubin NVL72、NVIDIA Vera CPU、NVIDIA Groq 3 LPX、NVIDIA Vera BlueField-4 STX,以及 NVIDIA Spectrum-6 SPX 乙太網路。這些機架專為協同運作而設計,可整合成一部強大的 AI 超級電腦,為 AI 的每個階段提供運算動力,涵蓋大規模預先訓練、後期訓練與測試階段擴展,以及即時代理 AI 推論。

NVIDIA Vera Rubin NVL4

NVIDIA Vera Rubin NVL4 透過四顆 NVIDIA Rubin GPU 帶來革命性的效能。這些 GPU 採用搭載第六代 NVIDIA NVLink 的第二代 NVLink 橋接器互連,並透過 NVLink-C2C 與兩顆 NVIDIA Vera CPU 連接。NVIDIA Vera Rubin NVL4 相容於採用液冷技術的 NVIDIA MGX™ 模組化伺服器,相較於 Grace Hopper,科學運算模擬效能最高可達 4 倍、AI 科學訓練效能最高可達 6 倍,AI 科學推論效能最高可達 8 倍。

規格

100 MW AI 工廠規格

  NVIDIA Vera Rubin NVL72 型 AI 工廠¹
AI 工廠規模配置 搭載 MaxLPS 的 40K NVIDIA Rubin GPU
NVFP4 推論² 2 ZFLOPS
NVFP4 訓練³ 1.4 ZFLOPS
FP8/FP6 訓練³ 700 EFLOPS
FP16/BF16³ 160 EFLOPS
TF32³ 80 EFLOPS
GPU 記憶體 | 頻寬 12 PB HBM4 | 800 PB/s
CPU 記憶體 最高 30 PB LPDDR5X
快速記憶體 最高 42 PB

NVIDIA Vera Rubin NVL72 規格

  NVIDIA Vera Rubin NVL72 NVIDIA Vera Rubin 超級晶片 NVIDIA Rubin GPU
配置 72 個 NVIDIA Rubin GPU | 36 個 NVIDIA Vera CPU 2 個 NVIDIA Rubin GPU | 1 個 NVIDIA Vera CPU 1 個 NVIDIA Rubin GPU
NVFP4 推論² 3,600 PFLOPS 100 PFLOPS 50 PFLOPS
NVFP4 訓練³ 2,520 PFLOPS 70 PFLOPS 35 PFLOPS
FP8/FP6 訓練³ 1,260 PFLOPS 35 PFLOPS 17.5 個 PFLOPS
FP16/BF16³ 288 PFLOPS 8 PFLOPS 4 PFLOPS
TF32³ 144 PFLOPS 4 PFLOPS 2 個 PFLOPS
FP32 9,360 TFLOPS 260 每秒浮點運算次數 130 每秒浮點運算次數
FP64 2,400 TFLOPS 67 TFLOPS 33 每秒浮點運算次數
GPU 記憶體 | 頻寬 20.7 TB HBM4 | 1,400 TB/s 576 GB HBM4 | 38.5 TB/s 288 GB HBM4 | 19.2 TB/s
NVIDIA NVLink 第六代
NVLink 頻寬 216 TB/s
6 TB/s 3 TB/s
NVLink-C2C 頻寬 65 TB/s 每秒 1.8 TB -
CPU 核心數量 3,168 個自訂 NVIDIA Olympus 核心 | 6,336 個執行緒 88 個自訂 NVIDIA Olympus 核心 | 176 個執行緒 -
CPU 記憶體 最高 54 TB LPDDR5X 最高 1.5 TB LPDDR5X -
網路頻寬 (橫向擴充)⁴ 32.4 TB/s 0.9 TB/s 0.45 TB/s
NVIDIA + HBM4 晶片總數 1,296 30 12
100 MW 中的 GPU 數量¹ 40K GPU
入風口溫度 45°C

1. 規格以採用 NVIDIA DSX 與 MaxLPS 的大規模 AI 工廠為基準。
2. 稀疏規格。
3. 高密度規格。
4. 雙向頻寬。

立即開始

隨時掌握 NVIDIA 最新消息

訂閱以接收 NVIDIA 的最新消息與更新。