ホワイト ペーパー
AI はトークンで実行されます。 それらをどのように利用、拡張、生成、収益化するかが、AI の競争上の優位性を決めます。 ユース ケース毎に最適なモデルとコンテキスト長を選択し、電力あたりのトークン処理量を最大化しつつ、トークンあたりのコストを最小限に抑えるインフラを導入することで、大規模な収益拡大と利益率向上を実現します。
データ センターは AI トークン ファクトリーになりつつあります。 かつてはトランザクションを処理し、Web ページを配信していたデータセンターが、現在では新たな種類のアウトプットを生み出しています。それが、AI モデルが推論時に生成するインテリジェンスの単位である「トークン」です。AI の活用が実験から本番環境に移行するにつれて、推論が主要なワークロードとなり、トークンは企業が生産、管理、収益化のために学ばなければならない新たなコモディティとなっています。
トークノミクスとは?これはトークンの生成と利用の経済学であり、エコシステムで頻繁に使用される用語ですが、この表現では正確さに欠けているとも言えます。トークノミクスの本質を理解するには、トークンが「どのように価値づけられ、消費され、供給され、収益化されるか」という観点から捉えると分かりやすくなります。
トークノミクスには、相互に関連した 4 つの柱から成り立っています。
トークノミクスの各要素は、それぞれ独立して存在するものではありません。 供給に関する意思決定は利益率に直接影響し、需要予測はインフラの要件を決定し、トークン ユーティリティは課金できる量の上限を決めます。 これら 4 つの柱は相互依存関係にあり、それらを正しく見極めることが持続可能な AI ビジネスと高コストな実験との違いを決めるものです。 本ホワイト ペーパーでは、それぞれについて詳しく探り、企業が AI のデプロイ計画や拡張のためのフレームワークを提供しています。
すべてのトークンが同じ価値を持つわけではありません。トークンの価値は、2 つの次元によって異なります。
インテリジェンスが高く、インタラクティブ性が高速化すればするほど、トークンを生成するコストが高くなります。 しかし、これらのトークンから得られる価値は、ユースケースに関連したものであり、そのユースケースがトークンを活用できるかどうかに完全に左右されます。事後学習済みの小規模言語モデル (SLM) は、ドメイン特化型タスクにおいて、より大規模でインテリジェントなモデルと同等かそれ以上の性能を、数分の一のコストで発揮できます。 一括処理のドキュメント処理パイプラインは、リアルタイムのコーディング アシスタントでは、求められるインタラクティブ性の要件が大きく異なります。追加的な価値は、アプリケーションがそれを活用できる場合にのみ、そのコストを支払う価値があります。
トークン ユーティリティは、一つのスペクトルとして捉えるのが最も適切です。つまり、検索やチャットボットなど、基本的な SLM または事後学習済みの SLM によって処理される高スループットでインタラクティブ性の低いワークロードから、エージェント型コーディングや自動化など、最長レベルのコンテキストで最大規模のモデルを必要とするほぼリアルタイムのワークロードまで、幅広い範囲に及ぶスペクトルです。戦略的なタスクは、各ユース ケースをそのスペクトル上の適切なポイントにマッピングすることです。
実践的なアプローチは、まず最先端の機能を使ってプロトタイピングと検証を行い、次に評価を通じて厳格なサービス レベル目標 (SLO) を定義し、最後に規模に適した最適化と適正化を行うというものです。そのプロセスの指針として、以下のような質問が参考になります。
このマッピングを正しく行うことは、下流に直接的な影響をもたらします。これにより、どのモデルを導入するか、インフラのニーズをどのように見積もるか、そして最終的には、生成されたトークンに対していくら課金するかが決まります。トークン ユーティリティは、需要、供給、収益化の意思決定が下される基盤です。
NVIDIA AI インフラは、幅広い独自モデルやオープンウェイト モデルをサポートすることで、最適なトークン価値を柔軟に選択できるという柔軟性を顧客に提供します。NVIDIA はまた、長時間実行可能な自己進化するエージェント向けに構築された、高効率かつマルチモーダルなオープン モデル ファミリーである Nemotron も構築しています。たとえば、Nemotron 3 Ultra は、コーディング ベンチマークに完了する際に使用するトークン総数、および 1 ターンあたりのトークン数が同等のモデルと比較して少なく、エージェント型タスクのコストを最大 30% 削減できます。
トークンの需要をどのように予測していますか? ユース ケースから始めることが、需要を予測やインフラ計画のツールとして活用する最も効果的な方法です。 市場では、消費者や企業のチャットボットから、コーディングやエージェント型自動化ツールに至るまで、ユース ケースが急速に拡大しています。この変化により、需要状況は数兆トークンの市場から数千兆トークン規模の市場へと急速に変化し、ワークロードやトークン需要の特性、そしてその単価を根本的に変えています。
企業には、AI ユース ケースに伴う設備投資や運用コストを計画する自社需要を予測する手法が必要です。 第一原理主導のアプローチは、3 つのレベルで構成されています。
3 層のトークン需要予測モデルは、ベース推定からワークロードの乗数、そして実世界のインフラストラクチャの要件を形作る運用上の需要変数まで、3 層のトークン需要予測モデルです。この色分けされた 3 レベルのモデルで、緑は従来のソフトウェア容量計画と共通するコンポーネントを示し、オレンジはトークン サービングに特有の変数 (リクエストあたりのトークン数、推論、エージェント ループ) を強調表示しています。
レベル 1 に基づく需要推定は、容量計画の出発点となります。 これらは、概念証明のデプロイにおける要件を理解するベースラインとして役立ちますが、本番環境に拡張できることはめったにありません。 ワークロードと需要の乗数により、トークンの需要を桁違いに拡大できます。下の例に示すように、インフラストラクチャが推定ベースの需要のみに基づいてプロビジョニングされた場合、関連するアプリケーションによる 1 日あたり 6 億以上のトークン不足が発生します。
運用上の需要 (レイヤー 3) を考慮するには、より詳細なレベルで需要をモデリングする必要があります。 このトークン需要予測ワークシートには、3 つのレベルすべてを順を追って説明できるよう、空欄を埋める形式のバージョンがあります。
トークンの需要予測は、実態としては従来のソフトウェアの容量計画から大きくかけ離れたものではありません。セッション、リクエスト、再試行、キャッシュ ヒット率、時間的パターン、遅延サービス品質保証 (SLA) などのほとんどの入力は、インフラ部門における既知の慣行と共通しています。トークンのサービングには、リクエストあたりのトークン数、推論オーバーヘッド、エージェントのループという 3 つの変数があります。ある特定のデプロイの需要プロファイルを他のデプロイと区別するのは、手法ではなくコンテキストです。つまりユース ケースやそれをデプロイする組織、ワークフローに組み込まれたアプリケーション設計の意思決定によって定義されます。
これら 3 つのレベルを、一時的な取り組みではなく、実在するモデルとして取り扱う組織は、エージェント型ワークロードの拡張とトークン需要の増加に伴い、インフラを適切な規模に調整する上で最も有利な立場に立つでしょう。
トークン供給は基本的に効率性の問題です。つまり、生成コストを最小化しながら生成量を最大化することが要求されます。
この実現には、モデル効率、システム効率、ソフトウェア効率にわたる共同最適化が必要です。単一の要素だけでは十分ではなく、3 つすべてをエコシステムと連携して設計する必要があります。 NVIDIA はこれを「極限の共同設計」と呼んでおり、モデルやアルゴリズム、コンピューティング、ネットワーク、メモリ、ストレージ、ソフトウェア、そしてパートナーや顧客のエコシステムまでを対象としています。各コンポーネントが連携することで、各部分の総和を超える価値を生み出し、システムが最小限のトークン コストを実現できるようにします。
モデル効率
Mixture-of-Experts (MoE) アーキテクチャは、各トークンに対して適切なパラメータのみをアクティブ化することで、モデル効率を大幅に向上させます。 たとえば、Kimi K2.5 には 1 兆パラメータがありますが、トークンあたり 320 億のみをアクティブ化することで、より大規模な高密度モデルと同等のインテリジェンスを、わずかな計算コストで実現します。その裏には、GPU 全体に分散するエキスパート間の通信という隠れたコストが存在します。MoE 推論は、複数のバッチ処理において GPU 間に大量の全対全トラフィックが発生するため、基盤となるシステムがそのトラフィックを大規模に処理できなければ、効率の向上は帳消しになってしまいます。
システム効率
NVIDIA GB200 NVL72 は、NVIDIA NVLink™ Switch を介して 72 基の GPU を接続し、1,800 ギガバイト/秒 (GB/s) の全対全の帯域幅を実現します。この GPU ドメインの拡大により、固定メッシュやシングルノードの構成、あるいは既製のイーサネットベースのスケールアップ アプローチを制約する通信のボトルネックを発生させることなく、最大 72 基の GPU にエキスパートを分散配置することが可能になります。これにより、MoE モデルが持つ理論的な効率を本番環境で実現できるようになります。
ソフトウェア効率
ハードウェアの潜在能力を最大限に引き出すには、インフラストラクチャ アクセス、アプリケーション アクセラレーション、オーケストレーションとサービングという 3 つのアーキテクチャ レイヤーにわたって最適化されたソフトウェア スタックが必要です。NVIDIA は、あらゆる最適化を同時に実現できる堅牢なソフトウェア スタックを提供しています。 これは思っているよりも難しいですが、複合効果により、トークン出力に飛躍的な改善が生じます。オープンソースのエコシステムと NVIDIA による継続的なソフトウェア最適化により、既存のハードウェアの生産性が時間の経過とともに向上します。
極限の共同設計の結果、GB200 NVL72 はトークンあたりのコストを業界最低に抑えることができました。
企業の制約内での最適化
ほとんどの企業は、既存のデータ センターのフットプリントや環境の制約の中でトークン コストを最適化する必要があります。 たとえば、ラックの平均電力密度は約 27 キロワット (kW) であり、データセンターの 75% が依然として水冷ではなく空冷を採用しています。 また、企業は、AI 以外にもデータ処理やグラフィック処理など、多様なワークロードを抱えていることが多く、これらの制約に対処するための初期費用が限られていることがあります。NVIDIA は、目的に合わせたオプションを提供しています。 NVIDIA HGX™ B200 および B300 は、空冷 AI ファクトリーにおいて最も低いトークン コストを実現します。 NVIDIA RTX PRO™ 6000 Blackwell は、エンタープライズ推論ワークロード向けに、前世代の NVIDIA Hopper™ システムと比較して最大 3 倍のトークン効率を実現します。
トークン生成効率
メガワットあたりのスループットとトークンあたりのコスト: 重要な指標
現在でもほとんどの組織が、GPU 時間あたりのコスト、ピーク時の 1 秒あたり浮動小数点演算実行回数 (FLOPS)、1 ドルあたりの FLOPS などの入力指標を使用して AI インフラストラクチャを評価しています。しかしながら、これらは AI インフラストラクチャの評価指標としては正しくありません。 NVIDIA Blackwell と Hopper を比較した 4 つの測定値が、その根拠を示しています。
最も重要な指標は、MW あたりのスループットとトークンあたりのコストです。
MW あたりのスループットは収益に影響し、トークンあたりのコストは、インタラクションあたりの収益性と、ビジネスの成長速度を左右します。 これらの指標は、ハードウェアのパフォーマンス、ソフトウェアの最適化、実世界の利用状況を 1 つの指標で捉えたものです。推論の総保有コスト (TCO) に関する詳細については、『AI の TCO を再考する: トークンあたりのコストが唯一重要な指標である理由』をご覧ください。
エージェント型 AI が成熟するにつれて、トークンあたりのコストと並んで、トークンあたりのインテリジェンス、タスクあたりのトークン数、タスクあたりのコストといった関連する概念も登場しています。タスクあたりのコストは、モデルがインテリジェンスを生成する効率 (トークンあたりのインテリジェンス) と、モデルがタスクを完了する際にトークンを活用する効率 (タスクあたりのトークン数) によって変わります。
ユーティリティは、トークンの価値を定義します。 需要はどの程度のトークンが誰によって消費されるかを予測し、供給が生産コストを決定します。
収益化は、これら 3 つの柱を結びつけ、経済が好調で持続可能なものになるようにトークンの価格設定や販売をどのように行うか、というビジネス上の中心的な疑問に答えます。
トークンをどのように収益化するかについて、単一の経済モデルは存在しません。 そこで、4 種類の主要な戦略を、異なるビジネスの背景や出発点ごとに使い分けることができます。
以下の価格設定メカニズムは、トークンの直接販売を基盤としています。トークンを基盤に構築された製品やサービスでも、そのアプローチは概念的に類似していますが、エンドユーザーに提供される付加価値も考慮に入れる必要があります。
組織がどのモデルを追求しようとも、価格設定の基本を正しく理解することは不可欠です。
トークン価格を決定する方法
トークンの価格設定を行う際には、3 つの重要な要素を考慮してください。
最終的に、トークン収益はトークン出力、トークン価格、および価格設定階層全体にわたる需要の分布によって決まります。利益率は、トークンを生成するコストによって決まります。 したがって、インフラストラクチャの意思決定は収益に直接関連します。 NVIDIA Vera Rubin プラットフォームは、スループットを向上させ、トークンあたりのコストを 1/10 に削減します。さらに、LPX を搭載した Vera Rubin は、プレミアム価格で高インタラクティブで高インテリジェンスなワークロードを実現し、価格設定のトップで収益機会と利益率を拡大します。
以下に示す導入事例は、組織がトークンの直接販売、AI ネイティブのサービスの構築、既存の製品やサービスの強化、内部運用の変革という 4 つのモデルそれぞれでこれらの戦略をどのように実践しているかを示しています。 このガイドの前半で示したパフォーマンスや効率は、完全な共同設計によって達成可能なことを示しています。 以下に記載されている導入事例では、その取り組みのさまざまな段階に直面している組織を紹介しており、その結果は、モデル選択、シーケンス長、数値精度、推論最適化、デプロイされたハードウェア等の組み合わせが反映されたものです。
概要
2019 年に設立された Cohere は、実世界のビジネス問題を解決する基盤モデルやエンドツーエンドの製品を開発する大手ソブリン AI 企業で、独自モデルの構築と、それらのモデルを活用した製品やソリューションの構築という、トークン経済の両面で事業を展開しています。同社の大規模言語モデル (LLM) の主要なファミリーとしては Command/North ファミリーが存在し、その中には Command A Vision (マルチモーダル) や Command A Translate といったモデル、さらに検索向けの Embed や Rerank が含まれます。
その他にもセキュアなエンタープライズ AI ワークスペースである North を開発しており、従業員がカスタマイズ可能な AI エージェントと協力して RAG による企業データの検索、ツールの使用、ワークフローの実行、自動化などができるのが特徴です。
目標
North は Cohere の独自モデルを基盤に運用されるため、あらゆるやり取りがトークンを必要とし、遅延の影響を受けやすいため、推論の効率が Cohere の利益率と製品品質に直接影響します。 このため、Cohere はトークンコストの最小化、遅延の低減、ノードあたりの高スループットを実現するために、最高の AI インフラストラクチャを必要としています。Cohere は、モデル、ハードウェア、負荷レベルを対象に、継続的なベンチマーク プログラムを運用しています。
ソリューション
Cohere は、本番環境のモデルを NVIDIA H100 から NVIDIA Blackwell B200 および GB200 に移行し、通常 FP8 の精度で動作させています。
成果
NVIDIA H100 と NVIDIA B200 を比較した Cohere の社内ベンチマークの結果、開発チームは以下のことを確認しました。
B200 が、H100 (最大 64 ユーザー) と比較して、ピーク時のスループットが向上したことを示す棒グラフ。
技術的な向上がビジネス価値につながる
ノードあたりのスループットの向上と遅延の短縮は、利益率の向上とより優れた製品の開発につながります。
全体的に見て、Cohere は、NVIDIA Blackwell を基盤にモデルやソリューションを提供することで、利益率の向上、規模、柔軟性の向上、そして顧客体験の向上を達成しています。
例えば、以下の表は、Cohere が NVIDIA Blackwell を活用して生み出した全般的なビジネス効果を示しています。
注: 測定されたスループットは、公開されている GPU の価格と組み合わせて算出されているものであり、Cohere の実際のコストではなく、影響の傾向を示しています。
100 万トークンあたりのコスト例 (同じ GPU 数、例: 3.50 ドル / 時 (H100) および 6.00 ドル / 時 (B200) = 1.71 倍の価格割り増し)
| モデル (シナリオ) | 100 万トークンあたりの H100 コスト | 100 万トークンあたりの B200 コスト | スループットの向上 | 1 ドルあたりのトークン数 |
|---|---|---|---|---|
| Command A Translate (1K/100) | $0.39 | $0.26 | 2.62x | +53% (-35% コスト) |
| Command A+ (10K/1K) | $0.128 | $0.113 | 1.93x | +13% (-11% コスト) |
| Command A Vision (1 画像) | $1.99 | $1.83 | 1.87x | +9% (-8% コスト) |
1 ドルあたりのトークン数増加 = スループットの向上 / GPU の割り増し価格。最大 1.7 倍以上のスループット (長コンテキスト、高並列性、翻訳) を実現した NVIDIA Blackwell は、トークンあたりのコストを大幅に削減します。 B200/H100 の価格差が縮まるにつれて、その利点も大きくなります (クラウド利用率は通常 1.5 倍に近くなります)。
まとめ
Perplexity は、正確な AI に焦点を当てた AI エージェント プラットフォームです。 同社のプラットフォームは、NVIDIA Nemotron™ 3 Ultra を含む 15 の AI モデルを活用しています。各ワークロードをパイプライン経由でコストと品質のバランスが最適なモデルに振り分けることで、顧客のパフォーマンス、品質、コストを最適化します。
「NVIDIA のハードウェアは、どの世代も、私たちに何か特別なものを提供してきました。当社のモデル フリートを提供できるのも NVIDIA Hopper があるからです。NVIDIA Blackwell は、より大規模な NVLink ドメインと Tensor コア上の MXFP8 に対応することで、遅延のコストを支払うことなく、複数のノードにデータを提供できるようになります。そのため、私たちが移行しようとしているワークロードは経済的に実現可能です」 – Perplexity 共同創業者兼 CTO 、Denis Yarats 氏
目標
Perplexity のビジネス目標は、エンタープライズ レベルの信頼性と成長に必要な経済性を維持しながら、消費者規模で正確な AI を提供することです。 Perplexity の本番環境インフラストラクチャは、すでに 15 のモデル フリートで 1 日 5,000 万件以上のクエリに対応しており、最初のトークンを提供するまでの時間の中央値 (P50 TTFT) は、高速な検索で 2.4 秒、高度な推論作業で最大 13 秒となっています。そのトラフィックが Perplexity コンピューターにおける数時間に及ぶエージェント型作業に移行するにつれて、Perplexity 非はインテリジェンスの各ユニットをより安価で、より高速に、より信頼性の高いものにしています。そのため、コストと遅延はトラフィックやタスクの複雑さに比例して非線形に増加します。
ソリューション
Perplexity の AI インフラは、NVIDIA Hopper や NVIDIA Blackwell など、複数世代の NVIDIA ハードウェアを基盤に構築されており、NVIDIA のデータセンター ソフトウェア スタックでオーケストレーションと最適化されています。
Perplexity は、精度や遅延を損なうことなく、トークンあたりのコストを削減するために、NVIDIA を基盤に推論スタックを構築しました。 GPU の世代が新しくなるごとにパフォーマンスは大幅に向上します。さらに、FlashInfer、CuTe DSL、SHARP、MXFP8 量子化、および非集約型のプリフィル サービングやデコード サービングと組み合わせることで、GPU 1 時間あたりより多くのトークンを抽出できるようになります。
成果
Perplexity は、マルチノード GB200 で、シングルノード H200 と比較して、出力トークンコストを約 2~4 倍向上させることができ、また、MoE モデルにおけるディスパッチ遅延を 46.5% 短縮しました。
遅延の短縮
以下のグラフは、NVLink と NVLS トランスポートを使用した H200 と GB200 における MoE のディスパッチ遅延を比較したものです。NVLS を搭載した GB200 は、NVLS を搭載した H200 と比較して、ディスパッチ遅延を 46.5% 短縮できることが示されています (313.3 μs と 586.1 μs)。
Perplexity
スループットの向上
次のグラフは、GB200 (EP = 4/8/16) および H200 (EP = 8/16) のデコード速度と比較して GPU あたりのデコード スループットをプロットしています。これにより、GB200 のマルチノード導入では、NVLink ドメインの規模が大きいため、同じデコード速度でも H200 のシングルノードと比較して、GPU あたり 2~4 倍のスループットを実現できます。
Perplexity
まとめ
Canva の使命は、世界中の誰もがデザインできるようにすることです。同社 の AI デザイン ツール スイートは、ソーシャル メディアへの投稿からプレゼンテーション、短い動画まで、誰もが最高のパフォーマンスを発揮できるよう支援します。同社の Design スイートには、画像から動画を生成する AI ジェネレーターがあります。この静止画から短いアニメーション クリップへの変換機能を、特別なソフトウェアを導入することなくあらゆるデバイスで利用することができるため、最も人気のある機能のひとつとなっています。
「NVIDIA と提携することで、Canva は、ユーザーが期待するスピードと品質を維持しながら、画像から動画への変換など、AI を活用したクリエイティブ体験の効率を向上させることができます。より多くの人々が高度なクリエイティブ ツールを利用できるようになる鍵は、効率性です」 – Canva AI 研究責任者、Stefano Corazza 氏
目標
Canva は現在、月間アクティブ ユーザー数が 2 億 6500 万人以上であり、世界で最も広く利用されている 3 つの AI アプリケーションの 1 つとなっています。 人気の画像から動画を生成する AI ジェネレーターを誰でも利用できるよう、Canva は、NVIDIA を活用した専用推論インフラストラクチャを構築しました。 これにより、生成される動画は業界最高水準の品質を満たしつつ、生成あたりのコストと遅延を妥当なレベルに抑えることができます。
ソリューション
Canva は NVIDIA 上で画像から動画を生成する推論スタックを実行することで、精度や遅延を犠牲にすることなく、生成あたりのコストを削減しています。この機能は、NVIDIA B200 で提供される Diffusion-Transformer ビデオ モデルによって実現されます。 最適化された分散推論および後処理パイプラインとハードウェア特化型カーネルを組み合わせることで、Canva は GPU 1 時間あたりにより多くの動画生成を実現し、無料の画像から動画への変換体験を世界中のユーザー ベースに拡大できるようになりました。
成果
Canva は、B200 での GPU 時間あたりの動画生成数は、H200 を使用した時と比較して 70% 多くなりました。
このワークシートの使い方: それぞれの [_blank_] に該当する数値を記入します。 各レイヤーの出力は、次のレイヤーに送られます。 各セクションの下の計算式には、具体的に何が掛け算され、その数値がどのように連鎖していくかが明確に示されています。
レイヤー 1: 基本的な需要
私たちは、各ユーザーが 1 日に約 [__________] タスクを実行する [________] 人のユーザーを対象に、このデプロイの規模を調整しています。 一般的なリクエストでは [__________] 個の入力トークンが送信され、モデルは [__________] 個の出力トークンを返却します。
入力
A. ユーザー ......................... [__________]
B. 各ユーザーの 1 日あたりのタスク数 ....... [__________]
C. 入力シーケンス長 (ISL) ...... [__________] トークン
D. 出力シーケンス長 (OSL) ...... [__________] トークン
計算
セッション数 / 日 = A × B
= [_____] × [_____]
= [_______________] セッション数 / 日
トークン / リクエスト = C + D
= [_____] + [_____]
= [_______________] トークン / リクエスト
ベース トークン / 日 = セッション数 × トークン / リクエスト
= [_____] × [_____]
= [_______________] トークン / 日
ベース トークン / 月 = 1 日分 × 30
= [_______________] トークン / 月
レイヤー 2: ワークロード乗数
各ステップで約 [__________] 個の隠れた推論トークンが使用され、1 つのタスク チェーンが [_____] 個のエージェント ステップを通じて実行されます。 失敗やフォールバックにより、[_____] 倍の再試行オーバーヘッドが発生し、すべての呼び出しに [____________] トークンのシステム プロンプトが付加されます。 プロンプト キャッシュは、システム プロンプト トークンの [_____]% にヒットします。
入力
E. ステップごとの推論トークン ....... [__________]
F. タスクごとのエージェントのステップ数 ........... [_____]
G. リトライ乗数 ................ [_____] ×
H. ステップごとのシステム プロンプト トークン ... [__________]
I. キャッシュのヒット率 ......................... [_____] %
計算
調整済みトークン / リクエスト = トークン / リクエスト + E
= [_____] + [_____]
= [_______________]
トークン / タスク (ステップあり) = 調整済みトークン × F
= [_____] × [_____]
= [_______________]
トークン / タスク (再試行数あり) = (トークン / タスク (ステップあり) ) × G
= [_____] × [_____]
= [_______________]
1 日あたりのキャッシュ節約量 = H × (I / 100) × F × セッション数
= [_____] × [_____] × [_____] × [_____]
= [_______________] トークン節約 / 日
有効トークン / 日 = (トークン / タスク × セッション数) − キャッシュ節約量
= [_____] − [_____]
= [_______________] トークン / 日
有効トークン / 月 = 1 日分 × 30
= [_______________] トークン / 月
レイヤー 3: 運用上のシェーピング
毎日のトラフィックの約 [_____] % が、[_____] 時間の業務時間内に発生します。 そのピーク中には、実際のトラフィックは業務時間内平均の [_____] 倍に達し、繁忙期ではさらに [_____] 倍増加します。 遅延 SLA を満たすために、[_____] 倍余分なヘッドルームを維持します。
入力
J. ピーク時の集中率 ......... [_____] %
K. 業務中のピーク発生時間 ............... [_____] 時間
L. バースト率 ...................... [_____] ×
M. 繁忙期の急増倍率 ........... [_____] ×
N. 遅延 SLA の余裕 ............... [_____] ×
計算
平均 TPM (1 分あたりのトークン数) (24 時間) = 1 日あたりの有効トークン数 ÷ 1,440
= [_____] ÷ 1,440
= [_______________] トークン / 分
平均 TPM (ピーク時間) = (1 日あたりの有効トークン数 × J/100) ÷ (K × 60)
= ([_____] × [_____]) ÷ ([_____] × 60)
= [_______________] トークン / 分
ピーク バースト TPM = ピーク TPM × L
= [_____] × [_____]
= [_______________] トークン / 分
ピーク TPM + SLA = バースト × N
= [_____] × [_____]
= [_______________] トークン / 分
ピーク TPM + 繁忙期急増分 = (ピーク TPM + SLA) × M
= [_____] × [_____]
= [_______________] トークン / 分
NVIDIA トークノミクスは、ワットあたりの AI トークン生成コストと収益を最適化することに焦点を当て、NVIDIA Blackwell や Vera Rubin などのアーキテクチャを通じて、トークンあたりの全体的なコストの削減を目指しています。 インフラストラクチャの価格設定やソフトウェア ライセンスについてご相談いただく場合、以下のフォームからご連絡ください。