打造代理 AI 的下一波尖端技術,現已全面投入生產。
概覽
NVIDIA Vera Rubin NVL72 整合 NVIDIA 的尖端技術,包括 72 個 Rubin GPU、36 個 Vera CPU、NVIDIA ConnectX™-9 SuperNIC 與 BlueField™-4 DPU。這款電腦採用 NVIDIA NVLink™ 6 交換器,於一致性機架級平台垂直擴充智慧處理能力,並採用 NVIDIA Quantum-X800 InfiniBand 與 Spectrum-X™ 乙太網路橫向擴充,大規模推動 AI 產業革命。搭配 NVIDIA Groq 3 LPX 機架部署時,Vera Rubin NVL72 可為兆級參數模型與百萬 Token 上下文帶來全新境界的推論效能。
Vera Rubin NVL72 採用第三代 NVIDIA MGX™ NVL72 機架設計,可從前幾代產品無縫轉換。相較於 NVIDIA Blackwell,它僅需四分之一的 GPU 即可進行 AI 訓練,AI 推論的每百萬 Token 成本更降至十分之一。這款機架級 AI 超級電腦採用無纜線模組化托盤設計,並獲得逾 80 個 MGX 生態系合作夥伴支援,可快速部署,實現世界級效能。
效能
LLM 推論效能可能會有所變更。根據使用 32K/8K ISL/OSL 的 Kimi-K2 思考模型,比較 NVIDIA GB200 NVL72 與 NVIDIA Vera Rubin NVL72 每 100 萬個 Token 的成本。
NVIDIA Vera Rubin NVL72 每百萬 Token 的成本僅為 NVIDIA GB200 NVL72 的十分之一,實現高度互動、深度推理的代理 AI。
NVIDIA Vera Rubin NVL72 每兆瓦能提供高達十倍 NVIDIA GB200 NVL72 的 Token 數量,在相同的功耗下擴展智慧。
LLM 推論效能可能會有所變更。根據使用 32K/8K ISL/OSL 的 Kimi-K2 思考模型,比較 NVIDIA GB200 NVL72 與 NVIDIA Vera Rubin NVL72 的每秒每兆瓦 Token 數量。
此為預測效能,之後可能會有所變動。採用 10T MoE 模型的 GPU 數量,在 1 個月的固定時限內,使用 100T Token 進行訓練,比較 NVIDIA GB200 NVL72 與 NVIDIA Vera Rubin NVL72。
NVIDIA Vera Rubin NVL72 訓練mixture-of-experts (MoE) 模型時,GPU 數量僅為 NVIDIA GB200 NVL72 的四分之一。
代理系統消耗的 Token,最高可達傳統 AI 應用程式的 15 倍。AI 工廠必須以低延遲與高效的經濟效益,提供 Token 運算量以及處理海量的情境視窗。Vera Rubin NVL72 搭配 LPX 時,可為兆參數模型提供高達 35 倍的每兆瓦傳輸量。
此為預測效能,之後可能會有所變動。免費方案 ($0):Qwen-3 2350 億參數模型,支援 3.2 萬鍵值 (KV) 快取 Token。中階方案 ($3):Kimi K2.5 一兆參數模型,支援 12.8 萬鍵值 (KV) 快取 Token。高階方案 ($6):GPT-MoE 兩兆參數的模型,支援 12.8 萬鍵值 (KV) 快取 Token。頂級方案 ($45) 與超級方案 ($150) 方案:GPT-MoE 兩兆參數模型,支援 40 萬鍵值 (KV) 快取 Token。
推動 AI 代理程式時代
Vera Rubin 平台以五款機架開啟代理 AI 的下一波浪潮,協助全球 AI 工廠擴展規模,包括 NVIDIA Vera Rubin NVL72、NVIDIA Vera CPU、NVIDIA Groq 3 LPX、NVIDIA Vera BlueField-4 STX,以及 NVIDIA Spectrum-6 SPX 乙太網路。這些機架專為協同運作而設計,可整合成一部強大的 AI 超級電腦,為 AI 的每個階段提供運算動力,涵蓋大規模預先訓練、後期訓練與測試階段擴展,以及即時代理 AI 推論。
NVIDIA Vera Rubin NVL4 透過四顆 NVIDIA Rubin GPU 帶來革命性的效能。這些 GPU 採用搭載第六代 NVIDIA NVLink 的第二代 NVLink 橋接器互連,並透過 NVLink-C2C 與兩顆 NVIDIA Vera CPU 連接。NVIDIA Vera Rubin NVL4 相容於採用液冷技術的 NVIDIA MGX™ 模組化伺服器,相較於 Grace Hopper,科學運算模擬效能最高可達 4 倍、AI 科學訓練效能最高可達 6 倍,AI 科學推論效能最高可達 8 倍。
規格
| NVIDIA Vera Rubin NVL72 型 AI 工廠¹ | |
|---|---|
| AI 工廠規模配置 | 搭載 MaxLPS 的 40K NVIDIA Rubin GPU |
| NVFP4 推論² | 2 ZFLOPS |
| NVFP4 訓練³ | 1.4 ZFLOPS |
| FP8/FP6 訓練³ | 700 EFLOPS |
| FP16/BF16³ | 160 EFLOPS |
| TF32³ | 80 EFLOPS |
| GPU 記憶體 | 頻寬 | 12 PB HBM4 | 800 PB/s |
| CPU 記憶體 | 最高 30 PB LPDDR5X |
| 快速記憶體 | 最高 42 PB |
| NVIDIA Vera Rubin NVL72 | NVIDIA Vera Rubin 超級晶片 | NVIDIA Rubin GPU | |
|---|---|---|---|
| 配置 | 72 個 NVIDIA Rubin GPU | 36 個 NVIDIA Vera CPU | 2 個 NVIDIA Rubin GPU | 1 個 NVIDIA Vera CPU | 1 個 NVIDIA Rubin GPU |
| NVFP4 推論² | 3,600 PFLOPS | 100 PFLOPS | 50 PFLOPS |
| NVFP4 訓練³ | 2,520 PFLOPS | 70 PFLOPS | 35 PFLOPS |
| FP8/FP6 訓練³ | 1,260 PFLOPS | 35 PFLOPS | 17.5 個 PFLOPS |
| FP16/BF16³ | 288 PFLOPS | 8 PFLOPS | 4 PFLOPS |
| TF32³ | 144 PFLOPS | 4 PFLOPS | 2 個 PFLOPS |
| FP32 | 9,360 TFLOPS | 260 每秒浮點運算次數 | 130 每秒浮點運算次數 |
| FP64 | 2,400 TFLOPS | 67 TFLOPS | 33 每秒浮點運算次數 |
| GPU 記憶體 | 頻寬 | 20.7 TB HBM4 | 1,400 TB/s | 576 GB HBM4 | 38.5 TB/s | 288 GB HBM4 | 19.2 TB/s |
| NVIDIA NVLink | 第六代 | ||
| NVLink 頻寬 | 216 TB/s |
6 TB/s | 3 TB/s |
| NVLink-C2C 頻寬 | 65 TB/s | 每秒 1.8 TB | - |
| CPU 核心數量 | 3,168 個自訂 NVIDIA Olympus 核心 | 6,336 個執行緒 | 88 個自訂 NVIDIA Olympus 核心 | 176 個執行緒 | - |
| CPU 記憶體 | 最高 54 TB LPDDR5X | 最高 1.5 TB LPDDR5X | - |
| 網路頻寬 (橫向擴充)⁴ | 32.4 TB/s | 0.9 TB/s | 0.45 TB/s |
| NVIDIA + HBM4 晶片總數 | 1,296 | 30 | 12 |
| 100 MW 中的 GPU 數量¹ | 40K GPU | ||
| 入風口溫度 | 45°C | ||
1. 規格以採用 NVIDIA DSX 與 MaxLPS 的大規模 AI 工廠為基準。
2. 稀疏規格。
3. 高密度規格。
4. 雙向頻寬。
立即開始
訂閱以接收 NVIDIA 的最新消息與更新。