白皮書
消耗 Token,AI 才能運作。如何使用、擴展、生成 Token,並將 Token 轉化為實質營收,攸關您在 AI 領域的競爭優勢。為不同使用案例挑選最適合的模型與情境長度,打造能將每瓦 Token 產量最大化並降低成本的基礎架構,並在大規模運作下提升營收與利潤。
資料中心正在轉型成為 AI Token 工廠。傳統資料中心是用來處理交易與提供網頁服務的地方,現在則轉而製造一種全新的產物「Token」,這是 AI 模型在推論時所產生的智慧單位。隨著 AI 從實驗走向實際商業模式,推論儼然成為 AI 最重要的工作負載,而 Token 則像新商品,企業必須學習如何生成、管理 Token,並將其轉化為實際收益。
Token 經濟學是什麼?Token 經濟學代表著生成與使用 Token 的成本效益,也是生態系統經常提及的術語,但這個術語有時候太過於籠統。若想深究 Token 經濟的真正含意,我們可以將其視為「評估 Token 價值、使用 Token、供應 Token,並將其轉化為實質營收」的學問。
Token 經濟學涵蓋四大核心支柱,這四大支柱彼此息息相關:
Token 經濟學四大支柱是完整的流動系統。供應相關決策會直接影響利潤,需求預測決定了基礎架構需求,而 Token 用途則決定了收費上限。這四大支柱彼此缺一不可,唯有將這四個方面都做好,AI 產業才有可能生生不息,而非只是一場成本昂貴的失敗實驗。本文將深入探討每項要素,為正在規劃或準備擴大 AI 使用範圍的企業提供一套框架。
即便是 Token,彼此的價值也是有所差異。下列兩個因素決定了 Token 的價值:
越聰明、互動性越快,這些 Token 的製造成本就越高。但這些 Token 價值其實沒有絕對的高低,而是要看使用案例,以及使用案例能不能完全利用這些 Token 的價值而定。在特定領域的任務成效上,後期訓練小型語言模型 (SLM) 足以比擬或贏過更大、更聰明的模型,且成本低很多。批次文件處理流程與即時程式碼編寫助理的互動性要求有著天壤之別。要先確認應用程式能不能徹底發揮 Token 的額外價值,否則就是在浪費錢。
Token 用途可視為一個光譜,光譜一端是基本或後期訓練 SLM 所提供的高傳輸量、低互動性工作負載 (例如搜尋與聊天機器人),另一端則是需要大型模型、情境超長的半即時工作負載 (例如代理程式編寫程式碼與自動化)。我們的任務策略則是對症下藥,將每個使用案例放到該光譜上的正確位置。
最務實的方法是先利用頂尖功能製造原型並驗證可行性,然後根據評估定義嚴格的服務級別目標 (SLO),最後將 Token 調整到最佳規模。能引導該流程的問題包括:
確認好上述問題的答案,會直接影響後續成果。包括要使用哪些模型、需要準備多大的基礎架構,以及最終生成的 Token 要收多少錢。Token 用途是建立供需與轉化營收決策的基礎。
NVIDIA AI 基礎架構支援各種專有模型與開放權重模型,讓客戶能根據自身需求,挑選最適合自己、最划算的 Token 方案。NVIDIA 還打造了 Nemotron,這是一系列高效率、多模態的開放模型,專為長期執行、能自我進化的代理程式打造。舉例來說,與同類模型相比,Nemotron 3 Ultra 完成程式碼編寫基準測試時所使用的 Token 總量與每輪使用數量更少,且最多能將代理型任務的成本降低 30%。
如何預測 Token 需求?如果想將需求當成預測與基礎架構規劃工具,最有效的方式就是將使用案例當作第一步。從消費者與企業聊天機器人、編寫程式碼,再到代理程式自動化,不難看出,市場的使用案例正在大肆擴張。需求格局正在迅速轉變,Token 的市場需求從數兆個擴大至數千兆個,這不僅徹底改變了工作負載,也改變了 Token 需求特徵及單位成本。
企業需要一套能預測自身對於 AI 使用案例需求的方法,藉此規劃相關資本支出與營運支出。以第一原理為主的處理方式可分成三層:
Token 需求三層預測模型根據基本評估、工作負載倍率及營運需求變數層層推導出實際基礎架構需求。這款三層預測模型還有顏色編碼:綠色代表與傳統軟體容量規劃共享的元件,橘色則是強調 Token 服務的獨特變數 (每個請求、推理、代理程式循環所需的 Token 數量)。
第 1 層需求評估是容量規劃的第一步。我們通常會將其當成概念驗證部署需求的基準,但幾乎不會將其套用到正式環境。工作負載需求倍率能將 Token 需求放大到好幾倍。在以下範例中,如果只根據基本需求評估來佈建基礎架構,相關應用程式缺少的 Token 每天將超過 6 億。
營運需求 (第 3 層) 方面,則需要把要素拆得更細,再來分析需求。這份空白的 Token 需求預測工作表會帶著各位一步步填完三個層級的相關問題。
Token 需求預測與傳統軟體容量規劃間的差別似乎沒有想像中那麼大。大部分輸入內容 (包括工作階段、請求、重試、快取命中率、時間模式與延遲服務等級協議 (SLA)) 其實都和基礎架構團隊熟悉的實務做法相通。只有三個變數是 Token 服務才有的變數,那就是每個請求、推理負荷、代理程式循環所需的 Token 數量。兩個系統部署需求之所以有所不同,關鍵在於情境,而不是方法。核心要素有三個:使用案例、部署組織,以及工作流程中使用的應用程式設計決策。
如果組織能持續更新這個三層模型,而不是將其當成只做一次就放棄的專案,就能在代理式工作負載與 Token 需求增加時,更有效率地調整基礎架構。
基本上,Token 供應就是在講效率:一邊將 Token 成本降至最低,一邊將 Token 產量最大化。
如果想達成這個目標,就必須同時調整模型效率、系統效率與軟體效率。只調整其中一項是不夠的。三者必須結合生態系統一同設計。這就是 NVIDIA 所謂的「極致協同設計」,這項設計涵蓋了模型與演算法、運算、網路、記憶體、儲存空間、軟體,以及合作夥伴與客戶的生態系統,每個元件 緊密協同合作,發揮出「1+1+1>3」的力量,藉此讓系統產生的 Token 成本降至最低。
模型效率
混合專家 (MoE) 架構在處理每個 Token 時,只會啟動一部分相關參數,因此能大幅提升模型效率。舉例來說,Kimi K2.5 擁有 1 兆個參數,但每個 Token 只啟動 320 億個參數,運算成本只需幾分之一,卻能展現出跟大型密集模型一樣聰明的能力。各 GPU 專家彼此通訊所產生的開銷正是隱藏成本。MoE 推論時會產生大量跨 GPU 的 All-to-All 通訊流量,如果基礎系統無法處理這種大規模通訊流量,那麼效率便會大打折扣。
系統效率
NVIDIA GB200 NVL72 透過 NVIDIA NVLink™ 交換器連接 72 個 GPU,讓 All-to-All 頻寬達到 1,800 GB/s。這個大型 GPU 最多能將專家分散到 72 個 GPU 上,避免出現傳統固定網格、單節點架構或現成乙太網路擴充方法的通訊瓶頸。這也確保了 MoE 模型即使到了現實環境,也能發揮出理論效率。
軟體效率
如果想徹底發揮硬體的潛力,必須將三個架構層面 (基礎架構存取、應用程式加速,以及協調與服務) 的軟體堆疊調整至最佳狀態。NVIDIA 提供強大的軟體堆疊,能讓系統同時啟動所有最佳化功能。這件事做起來比想像中還要難,但積少成多,只要慢慢進步,製造出來的 Token 就會迎來巨大的突破。開源生態系統與 NVIDIA 不斷調整軟體,讓現有硬體越來越有生產力。
正因為實施了極致協同設計,GB200 NVL72 每個 Token 的成本才能成為業界最低。
企業限制內的最佳化
大部分企業必須在現有資料中心空間與環境限制內,設法降低 Token 成本。舉例來說,機架平均功率密度約為 27 千瓦 (kW),仍有 75% 的資料中心採用氣冷式設計,而不是水冷式設計。除了 AI 之外,企業通常還有許多不同的工作負載,例如資料或圖形處理,但因預算有限,無法解決這些限制。NVIDIA 為這些企業量身打造了專屬選項。在採用氣冷式設計的 AI 工廠中,NVIDIA HGX™ B200 與 B300 能將 Token 成本降至最低。至於企業推論工作負載方面,則能使用 NVIDIA RTX PRO™ 6000 Blackwell,該硬體 Token 效率最高可達上一代 NVIDIA Hopper™ 系統的 3 倍。
Token 生成效率
每兆瓦傳輸量與每 Token 成本:最該關注的指標
大部分組織在評估 AI 基礎架構時,還在使用每小時 GPU 成本、每秒浮點運算次數 (FLOPS) 或每美元 FLOPS 等輸入指標。用這些指標來評估 AI 基礎架構是錯的。從四項測量結果來比較 NVIDIA Blackwell 與 Hopper,得出的結果也證明了這個說法:
最該關注的指標是每兆瓦傳輸量與每 Token 成本。
每兆瓦傳輸量影響的是收益,而每 Token 成本則決定了每次互動的盈利能力及企業成長速度。這些指標將硬體效能、軟體最佳化與實際使用率全部整合進同一個指標。如果想深入研究推論總擁有成本,請參閱重新思考 AI 總擁有成本 (TCO):為何每 Token 成本才是唯一關鍵指標。
代理 AI 技術越來越成熟,每 Token 成本已經不足以涵蓋整體價值,業界也開始關注相關概念:每 Token 聰明程度、每任務 Token 及每任務成本。每任務成本取決於模型生成智慧結果的效率 (每 Token 聰明程度) 及模型使用 Token 完成任務的效率 (每任務 Token) 這兩個關鍵因素。
Token 用途定義了 Token 的價值。需求預測了 Token 消耗數量與對象。供應決定了製作 Token 的成本。
貨幣化則整合了這三大支柱,並為核心商業問題提供了答案:如何定價、銷售 Token,才能既有利潤可圖,又能永續經營?
目前沒有一個經濟模型能為 Token 創造實際價值。市場上發展出了四種關鍵策略,每種策略適合的商業情境與出發點都不盡相同。
下列定價機制以直接販售 Token 為例。販售以 Token 為基礎打造的產品與服務時,定價方式與傳統商品差不多,但組織也必須考慮到他們為終端使用者提供了多少附加價值。
無論組織採用了哪一種定價模型,都必須先搞清楚正確的定價原理。
如何決定 Token 定價
為 Token 定價時,需要考量三個重要因素:
最後,Token 能獲得多少收益,取決於 Token 產量、Token 價格,以及不同價格層級的需求分配比例。利潤取決於製造 Token 的成本。因此,基礎架構決策也會直接影響收益。NVIDIA Vera Rubin 平台可提升傳輸量,並將每 Token 成本降低 10 倍。此外,Vera Rubin 搭載 LPX 能解鎖高互動性、高聰明程度的工作負載,這不僅能讓定價提高,還能為公司創造更多營收與利潤。
以下案例研究展示了各個組織如何在這四種模型中實踐這些策略:直接販售 Token、打造 AI 原生產品及服務、改善現有產品與服務,以及內部營運轉型。本指南前面提供的效能與效率資料,證明了完整協同設計所能達到的效果。以下案例研究展示了處於不同階段的組織,並呈現出他們在模型選擇、序列長度、數值精度、推論最佳化與部署硬體等特定組合的成果。
摘要
Cohere 是 2019 年成立的頂尖主權 AI 公司,專門打造基礎模型與端到端產品,協助企業解決實際商業問題。Cohere 在 Token 經濟中兼顧了兩個要素,不僅打造了屬於自己的模型,也會利用這些模型打造產品與解決方案。Cohere 主要的大型語言模型 (LLM) 系列是 Command/North 模型系列,包括 Command A Vision (多模態)、Command A Translate,以及搜尋模型 Embed 與 Rerank。
Cohere 還開發了 North 企業級 AI 工作空間,在這裡,員工能安全地與可自訂 AI 代理合作完成工作任務,並透過 RAG 搜尋公司資料、使用工具、執行工作流程並推動自動化。
目標
因為 North 使用的是 Cohere 自己研究的模型,每次互動都要消耗 Token 且對延遲要求極高,因此,推論效率會直接影響 Cohere 的利潤與產品品質。正因如此,Cohere 需要最好的 AI 基礎架構,才能將 Token 成本與延遲降至最低,並提升每個節點的傳輸量。Cohere 要不斷針對模型、硬體與負載等級執行基準測試。
解決方案
Cohere 將主要生產模型從 NVIDIA H100 移至 NVIDIA Blackwell B200 與 GB200,執行時通常會將精度設定在 FP8。
結果
Cohere 在內部基準測試中,將 NVIDIA H100 與 NVIDIA B200 進行比較,團隊發現:
相較於 H100,B200 在配對掃描最高傳輸量方面 (最多 64 個使用者) 的提升幅度長條圖。
技術進步帶來商業價值
提升每個節點的傳輸量並降低延遲,都能轉化為利潤與更好的產品。
整體來說,NVIDIA Blackwell 提供了 Cohere 模型與解決方案,為其創造了更多利潤、更多業務量、更高的靈活性,以及更好的客戶體驗。
為了證明這點,下表顯示了 Cohere 使用 NVIDIA Blackwell 後,整體業務所受到的影響。
請注意:表中測出的傳輸量是搭配公開 GPU 價格,藉此對照成本趨勢,並非 Cohere 實際成本。
以每 100 萬個 Token 成本為例 (GPU 數量相同;示意為 $3.50/H100-hr 和 $6.00/B200-hr = 1.71 倍溢價)。
| 模型 (情境) | H100 每百萬 Token 的成本 | B200 每百萬 Token 的成本 | 傳輸量提升率 | 每美元 Token 數量 |
|---|---|---|---|---|
| Command A Translate (1K/100) | $0.39 | $0.26 | 2.62x | +53% (-35% 成本) |
| Command A+ (10K/1K) | $0.128 | $0.113 | 1.93x | +13% (-11% 成本) |
| Command A Vision (1 張影像) | $1.99 | $1.83 | 1.87x | +9% (-8% 成本) |
每美元 Token 提升率 = 傳輸量提升率/GPU 溢價。NVIDIA Blackwell 傳輸量只要超過 1.7 倍 (如長情境、多人同時工作、翻譯),就能降低每 Token 成本。隨著 B200/H100 價差縮小,優勢會變得越來越大 (雲端費率通常接近 1.5 倍)。
摘要
Perplexity 是個專心提供準確 AI 內容的 AI 代理平台。該公司平台使用了 15 個 AI 模型,包括 NVIDIA Nemotron™ 3 Ultra,只要有工作負載,系統就會透過流程為任務挑選 CP 值最高的模型來處理,藉此用最低的成本,為客戶呈現最佳的效能與品質。
「每一代 NVIDIA 硬體都為我們帶來了某些突破。NVIDIA Hopper 讓我們有足夠的能力提供模型服務。NVIDIA Blackwell 擴大了 NVLink 網域與 Tensor 核心上的 MXFP8,讓我們感受不到多少延遲,就能橫跨多個節點提供服務。讓過去繁雜的工作負載終於開始營利了。」 – Perplexity 共同創辦人兼技術長 Denis Yarats
目標
Perplexity 的商業目標是在普羅大眾提供精準 AI 內容,又不影響企業穩定性與成長所需的成本效益。Perplexity 的生產基礎架構支援 15 個模型,每天要處理 5000 萬次以上查詢,從製造首個 Token 時間的中位數來看,快速搜尋需要 2.4 秒,深度推理則大概需要 13 秒。越來越多長時間代理任務交給 Perplexity Computer 處理時,Perplexity 會讓每個智慧單位變得更便宜、更快速、更穩定,只要任務越多,成本與延遲時間的成長速度就會比任務複雜性的成長速度還要慢。
解決方案
Perplexity 的 AI 基礎架構採用多代 NVIDIA 硬體打造,包括 NVIDIA Hopper 與 NVIDIA Blackwell,並透過 NVIDIA 資料中心軟體堆疊來管理、調整其中問題。
Perplexity 在 NVIDIA 上打造推論堆疊,目的是在不影響準確度或延遲時間的情況下,降低每 Token 成本。每代 GPU 的效能都有顯著提升,搭配 FlashInfer、CuTe DSL、SHARP、MXFP8 量化技術,以及分離式預先填充與解碼服務時,每小時能製造更多 Token。
結果
與單節點 H200 相比,Perplexity 透過多節點 GB200 將 Token 成本降低了約 2 到 4 倍,MoE 模型上的調度延遲時間也降低了 46.5%。
降低延遲
下圖比較了在 H200 與 GB200 上,使用 NVLink 與 NVLS 傳輸技術時的 MoE 調度延遲時間,結果顯示,與 NVLS 搭配 H200 的 586.1 微秒相比,NVLS 搭配 GB200 的調度延遲時間為 313.3 微秒,降低了 46.5%。
Perplexity
提升傳輸量
下圖比較了每 GPU 解碼傳輸量與解碼速度,分別比較 GB200 (EP = 4/8/16) 與 H200 (EP = 8/16) 的情形下,結果顯示,由於 NVLink 網域更大,在相同的解碼速度下,GB200 多節點與 H200 單節點相比,每 GPU 傳輸量提升了 2 到 4 倍。
Perplexity
摘要
Canva 的使命是讓全世界的人都擁有設計能力。Canva 的 AI 設計工具套件可協助任何人盡情發揮想像力,從社群媒體貼文、簡報到短影片都能輕鬆完成。這款設計套件其中一項受歡迎的功能便是影像轉影片 AI 生成器,這項功能能把靜態照片變成簡短動畫,無需安裝任何軟體,任何裝置上都能使用。
「與 NVIDIA 合作之後,Canva 的影像轉影片等 AI 創意功能變得更有效率,使用者表示這就是他們要的速度與品質。這種效率是讓更多人接觸先進創意工具的關鍵。」 – Canva AI 研究主管 Stefano Corazza
目標
Canva 每月活躍使用者目前超過 2.65 億,是全球三大熱門 AI 應用程式之一。為了讓大家都能使用熱門的影像轉影片 AI 生成器,Canva 與 NVIDIA 合作,打造了一套專用推論基礎架構。不僅能讓影片達到業界最高標準,還能將每次生成成本與延遲時間維持在合理範圍。
解決方案
Canva 運用 NVIDIA 的技術執行影像轉影片推論堆疊,既不影響準確度或延遲時間,又能降低每次生成的成本。該功能由 NVIDIA B200 上的擴散轉換器影片模型支援。Canva 利用最佳化分散式推論、後製流程搭配硬體專用核心,讓每個 GPU 每小時都能生成更多影片,讓全球使用者都能體驗這個免費的影像轉影片功能。
結果
與 H200 相比,Canva 在 B200 上每個 GPU 每小時的影片生成效率提升 70%。
如何使用本工作表:在每個 [_blank_] 欄中填寫適當數字。每層輸出內容會變成下一層的輸入內容。每區段下的數學公式都清楚展示了相乘內容,以及一層層數值的計算方式。
第 1 層:基本需求
我們正為 [__________] 使用者評估此部署規模,每位使用者每天約執行 [__________] 個任務。典型請求會傳送 [__________] 個輸入 Token,模型會回傳 [__________] 個輸出 Token。
輸入內容
A. 使用者 .........................[__________]
B. 每位使用者每天的任務數量為 .......[__________]
C. 輸入序列長度 (ISL) ...... [__________] Token
D. 輸出序列長度 (OSL) ...... [__________] Token
數學公式
工作階段/日 = A × B
= [_____] × [_____]
= [_______________] 工作階段/日
Token/請求 = C + D
= [_____] + [_____]
= [_______________] Token/請求
基本 Token/天 = 工作階段 × Token/請求
= [_____] × [_____]
= [_______________] Token/天
基本 Token/月 = 每日 × 30
= [_______________] Token/月
第 2 層:工作負載倍率
每一步都會消耗約 [__________] 個隱藏推理 Token,且單一任務會串聯執行 [_____] 個代理程式步驟。失敗與後援會增加 [_____]× 重試負荷,我們會在每次呼叫中附加 [__________] token 系統提示。提示快取已命中 [_____]% 的系統提示 Token。
輸入內容
E. 每步驟推理 Token 為 .......[__________]
F. 每任務代理步驟為 ...........[_____]
G. 重試倍率為 ................[_____] ×
H. 每步驟系統提示 Token 為 ...[__________]
I. 快取命中率為 .................[_____] %
數學公式
調整後的 Token/請求 = Tokens/Req + E
= [_____] + [_____]
= [_______________]
Token/任務 (含步驟) = 調整後 × F
= [_____] × [_____]
= [_______________]
Token/任務 (含重試) = 上述 × G
= [_____] × [_____]
= [_______________]
快取節省成本/天 = H × (I / 100) × F × 工作階段
= = [_____] × [_____] × [_____] × [_____]
= [_______________] 節省 Token/天
有效 Token/天 = (Token/任務 × 工作階段) − 快取節省成本
= [_____] − [_____]
= [_______________] Token/天
有效 Token/月 = 每天 × 30
= [_______________] Token/月
第 3 層:營運塑造
每天約有 [_____]% 流量會於 [_____] 小時的營業時段造訪。在尖峰值內,實際流量會暴增至平常營業時段的 [_____] 倍,而旺季則會進一步提升 [_____] 倍。如果要滿足延遲服務等級協議,請維持 [_____] 倍額外餘裕空間。
輸入內容
J. 尖峰時段集中 .........[_____] %
K. 尖峰時段 ............... [_____] 小時
L.暴增率 .....................[_____] ×
M. 旺季因素 ...........[_____] ×
N. 延遲服務等級協議餘裕空間 ............[_____] ×
數學公式
Avg TPM (24 小時) = 有效每日 ÷ 1,440
= [_____] ÷ 1,440
= [_______________] Token/分鐘
Avg TPM (尖峰時段) = (有效每日 × J/100) ÷ (K × 60)
= ([_____] × [_____]) ÷ ([_____] × 60)
= [_______________] Token/分鐘
尖峰暴增 TPM = 尖峰 TPM × L
= [_____] × [_____]
= [_______________] Token/分鐘
尖峰 TPM + 服務等級協議 = 暴增率 × N
= [_____] × [_____]
= [_______________] Token/分鐘
尖峰 TPM + 季節 = 上述 × M
= [_____] × [_____]
= [_______________] Token/分鐘
NVIDIA Token 經濟主要是將每瓦生成 AI Token 的成本與收益最佳化,透過 NVIDIA Blackwell 與 Vera Rubin 等架構,降低 Token 整體成本。如果想討論基礎架構定價或軟體授權,請透過以下表格與我們聯絡。