Livre blanc
L'IA s'exécute sur des jetons (également appelés "tokens"). La façon dont vous utilisez, faites évoluer, générez et monétisez les jetons détermine l'avantage concurrentiel que peut vous fournir l'IA. Sélectionnez le modèle et la longueur de contexte optimaux pour chaque cas d'utilisation, déployez une infrastructure qui maximise le nombre de jetons par watt et minimise le coût par jeton, et stimulez vos revenus et la croissance de vos marges en toute évolutivité.
Les Data Centers deviennent des usines dédiées aux jetons d'IA. Ces infrastructures, qui traitaient autrefois les transactions et mettaient en œuvre des pages web, fabriquent désormais un tout nouveau type de résultat : les jetons, c'est-à-dire l'unité d'intelligence produite par les modèles d'IA pendant l'inférence. À mesure que l'IA passe de l'expérimentation à la production, l'inférence est devenue la charge de travail dominante, tandis que les jetons sont devenus la nouvelle marchandise que les entreprises doivent apprendre à produire, gérer et monétiser.
Qu'est-ce que la tokénomie ? Ce terme, qui désigne l'économie de la génération de tokens, est fréquemment utilisé par la plupart des acteurs de l'écosystème de l'IA, mais il peut manquer de précision. Pour comprendre ce que cela signifie réellement, il convient de s'intéresser à la manière dont les jetons sont évalués, consommés, fournis et monétisés.
La tokénomie englobe quatre aspects interconnectés :
Chaque pilier de la tokénomie ne saurait exister de manière isolée. Les décisions concernant l'offre influent directement sur les marges, les prévisions de la demande déterminent les exigences d'infrastructure, et l'utilité des jetons fixe un plafond en matière de facturation. Ces quatre piliers sont intrinsèquement interdépendants, et les mettre en œuvre correctement est ce qui permet de séparer les initiatives d'IA durables des expériences trop coûteuses. Ce dossier examine chaque pilier de manière détaillée, en fournissant un framework permettant aux entreprises de planifier ou de faire évoluer les déploiements d'IA.
Tous les jetons ne sont pas nécessairement égaux. La valeur d'un jeton dépend de deux dimensions distinctes :
Plus l'intelligence et l'interactivité sont élevées, plus ces jetons sont coûteux à produire. Mais la valeur obtenue à partir de ces jetons est relative au cas d'utilisation et dépend entièrement de la capacité du cas d'utilisation à tirer parti des jetons. Un petit modèle de langage (SLM) post-entraîné peut égaler ou surpasser un modèle beaucoup plus grand et plus intelligent afin de traiter des tâches spécifiques à un domaine avec un coût nettement plus bas. Un pipeline de traitement de documents par lots présente des exigences d'interactivité très différentes de celles d'un assistant de codage en temps réel. La valeur ajoutée ne vaut la peine d'être exploitée que si une application peut en tirer véritablement profit.
L'utilité des jetons est plus facile à comprendre quand on se réfère à un spectre allant des charges de travail interactives à haut débit et à faible interaction soutenues par des SLM de base ou post-entraînés, tels que la recherche et le chatbot, jusqu'aux charges de travail en temps quasi réel nécessitant les plus grands modèles avec le contexte le plus long, comme le codage de l'IA agentique et l'automatisation. La tâche stratégique consiste à cartographier chaque cas d'utilisation jusqu'au point approprié sur ce spectre.
Une approche pratique consiste à prototyper et à valider d'abord avec une capacité de pointe, puis à définir des objectifs stricts de niveau de service (SLO) par le biais d'une évaluation, avant d'optimiser et d'adapter les solutions d'évolutivité. Les questions qui contribuent à guider ce processus incluent :
La réalisation de cette cartographie a des conséquences directes en aval. Elle détermine quels modèles sont déployés, comment répondre aux besoins d'infrastructure et, en fin de compte, combien facturer pour les jetons produits. L'utilité des jetons est le pilier sur lequel les décisions relatives à la demande, à l'offre et à la monétisation sont basées.
L'infrastructure d'IA de NVIDIA offre aux clients la polyvalence nécessaire pour choisir la valeur optimale de jeton en prenant en charge une large gamme de pondérations ouvertes et de modèles propriétaires. NVIDIA développe également Nemotron, une gamme de modèles ouverts, multimodaux et hautement efficaces conçus pour les agents à longue durée et à évolution automatique. Par exemple, les benchmarks de codage Nemotron 3 Ultra ont été réalisés en utilisant moins de jetons au total et moins de jetons par tour que des modèles comparables, ce qui a permis de réduire jusqu'à 30 % le coût des tâches d'IA agentique.
Comment prévoir la demande en jetons ? Commencer par analyser le cas d'utilisation est le moyen le plus efficace d'utiliser la demande en tant qu'outil de prévision et de planification des infrastructures. Le marché connaît une importante expansion des cas d'utilisation, qui peuvent aller des chatbots grand public et d'entreprise au codage et à l'automatisation de l'IA agentique. Cette évolution transforme rapidement le paysage de la demande d'un marché de plusieurs billions de jetons à un marché pesant plusieurs billiards, modifiant fondamentalement les caractéristiques de charge de travail et de demande des jetons ainsi que, par extension, leur coût unitaire.
Les entreprises ont besoin de méthodologies pour prédire efficacement leurs propres besoins en matière de planification des dépenses en capital et opérationnelles associées à leurs cas d'utilisation de l'IA. L'approche fondée sur des principes premiers comprend trois niveaux :
Modèle de prévision de la demande de jetons à trois couches, des estimations de base aux multiplicateurs de charge de travail jusqu'aux variables de demande opérationnelles qui façonnent les exigences réelles de l'infrastructure. Le modèle à trois niveaux adopte un codage par couleur : le vert indique les composants partagés avec une planification traditionnelle de la capacité logicielle, et l'orange met en évidence les variables spécifiques à la mise à disposition de jetons (jetons par demande, raisonnement, boucles d'agents).
Les estimations de la demande basées sur le niveau 1 sont le point de départ de la planification de la capacité. Elles servent de référence pour la compréhension des exigences relatives aux déploiements de preuve de concept, mais sont rarement mis à l'échelle de manière effective lors de la phase de production. Les multiplicateurs de la demande en matière de charge de travail peuvent faire évoluer la demande en jetons par un ordre de grandeur. Comme le montre l'exemple ci-dessous, si l'infrastructure était provisionnée uniquement en fonction de l'estimation de base de la demande, l'application associée serait limitée à plus de 600 millions de jetons par jour.
Les exigences opérationnelles (c'est-à-dire la couche 3) nécessitent une modélisation à un niveau plus granulaire. Cette feuille de calcul dédiée à la prévision de la demande en jetons fournit une version prête à l'emploi pour vous guider à travers les trois niveaux.
La prévision de la demande en jetons s'écarte beaucoup moins de la planification traditionnelle que de la capacité logicielle. La plupart des entrées (parmi lesquelles : sessions, requêtes, nouveaux essais, taux de réussite du cache, modèles temporels et accords de niveau de service (SLA) de latence) sont partagées avec des pratiques que les équipes d'infrastructure connaissent déjà. Trois variables sont spécifiques aux jetons de service : le nombre de jetons par requête, la surcharge de raisonnement et les boucles d'agents. Ce qui différencie le profil de demande entre différents déploiements n'est pas la méthodologie, mais le contexte, avec des paramètres tels que le cas d'utilisation, l'entreprise qui le déploie et les décisions de conception d'applications intégrées au workflow.
Les entreprises qui traitent ces trois niveaux comme un modèle vivant plutôt que comme un exercice ponctuel seront les mieux placées pour déployer une infrastructure de taille appropriée à mesure que les charges de travail d'IA agentique évoluent et génèrent une forte demande en jetons.
L'approvisionnement en jetons repose fondamentalement sur l'efficacité, un paramètre qui contribue à maximiser le rendement de jetons tout en minimisant le coût de production des jetons.
Pour atteindre cet objectif, il faut co-optimiser l'efficacité des modèles, du système et des logiciels. Aucun composant unique n'est suffisant à lui seul. Les trois doivent être conçus conjointement, en harmonie avec leur écosystème. NVIDIA appelle cela la "co-conception extrême", une approche qui couvre les modèles et les algorithmes, les capacités de calcul, la mise en réseau, la mémoire, le stockage, les logiciels ainsi que l'écosystème de partenaires et de clients, chaque composant travaillant ensemble pour rendre l'ensemble supérieur à la somme de ses parties et permettre au système de générer le coût par jeton le plus bas possible.
Efficacité des modèles
Les architectures MoE (mixture-of-experts) offrent des gains significatifs en matière d'efficacité des modèles en exploitant uniquement les paramètres pertinents pour chaque jeton. Par exemple, Kimi K2.5 dispose d'un billion de paramètres, mais n'active que 32 milliards par jeton, offrant ainsi l'intelligence d'un modèle beaucoup plus dense à une fraction du coût de calcul. Le coût caché réside dans la communication entre les experts répartis sur plusieurs GPU. L'inférence MoE génère un important trafic All-to-All entre les GPU sur les lots, et les gains d'efficacité disparaissent si le système sous-jacent ne peut pas gérer ce trafic à grande échelle.
Efficacité du système
Le système NVIDIA GB200 NVL72 connecte 72 GPU via le commutateur NVIDIA NVLink, permettant d'obtenir une bande passante All-to-All de 1 800 gigaoctets par seconde (Go/s). Ce domaine GPU élargi permet de distribuer les experts sur jusqu'à 72 GPU, sans les goulets d'étranglement de communication liés aux configurations à maillage fixe, à nœud unique ou aux approches évolutives et prêtes à l'emploi basées sur Ethernet. Cela garantit que l'efficacité théorique des modèles MoE est respectée lors de la phase de production.
Efficacité logicielle
Pour exploiter pleinement le potentiel du matériel, il faut disposer d'une pile logicielle optimisée sur trois couches architecturales : l'accès à l'infrastructure, l'accélération des applications, ainsi que l'orchestration et la mise à disposition. NVIDIA fournit une pile logicielle robuste capable de permettre toutes les optimisations simultanément. C'est plus difficile qu'il n'y paraît, mais l'effet combiné est ce qui engendre des améliorations radicales pour la production de jetons livrés. Les optimisations logicielles continues effectuées par l'écosystème open source et NVIDIA rendent le matériel existant nettement plus productif au fil du temps.
Le résultat d'une co-conception extrême réside dans le coût par jeton le plus bas du secteur sur GB200 NVL72.
Optimisation conforme aux contraintes d'entreprise
La plupart des entreprises doivent optimiser le coût des jetons dans les limites de l'empreinte existante des Data Centers et des contraintes environnementales. Par exemple, la densité de puissance moyenne du rack est d'environ 27 kilowatts (kW), et 75 % des Data Centers sont encore refroidis par air plutôt que par eau. Les entreprises doivent également fréquemment faire face à des charges de travail mixtes en dehors de l'IA, telles que le traitement des données ou des graphismes, et une disponibilité limitée du capital initial pour répondre à ces contraintes. NVIDIA propose des options sur mesure. Les NVIDIA HGX B200 et B300 fournissent le coût par jeton le plus bas pour les usines d'IA refroidies par air. Le GPU NVIDIA RTX PRO 6000 Blackwell fournit une efficacité des jetons jusqu'à 3 fois supérieure à celle des systèmes NVIDIA Hopper de la génération précédente pour les charges de travail d'inférence d'entreprise.
Efficacité de la génération de jetons
Débit par mégawatt et coût par jeton : les paramètres qui comptent
La plupart des entreprises évaluent encore leur infrastructure d'IA à l'aide de mesures d'entrée telles que le coût par heure d'un GPU, le pic d'opérations à virgule flottant par seconde (FLOPS) ou les FLOPS par dollar. Ce sont des métriques inappropriées pour évaluer les infrastructures d'IA. Quatre mesures comparant les architectures NVIDIA Blackwell et Hopper démontrent ce postulat :
Les métriques qui comptent le plus sont le débit par mégawatt et le coût par jeton.
Le débit par mégawatt possède un impact sur les revenus, tandis que le coût par jeton détermine la rentabilité par interaction et la vitesse de croissance d'une entreprise. Ces mesures capturent les performances matérielles, l'optimisation logicielle et l'utilisation réelle via une seule métrique. Pour une étude plus approfondie du coût total de possession de l'inférence, nous vous invitons à consulter notre dossier Repenser le TCO de l'IA : pourquoi le coût par jeton est la seule métrique qui compte.
À mesure que l'IA agentique mûrit, des idées adjacentes émergent parallèlement au coût par jeton : intelligence par jeton, jetons par tâche et coût par tâche. Le coût par tâche est une fonction qui désigne l'efficacité avec laquelle un modèle génère de l'intelligence (intelligence par jeton) et l'efficacité avec laquelle un modèle utilise les jetons pour accomplir une tâche (jetons par tâche).
L'utilité définit la valeur d'un jeton. La demande prédit combien de jetons seront consommés et par qui. L'approvisionnement détermine le coût de la production.
La monétisation regroupe ces trois piliers et répond à une question commerciale fondamentale : comment fixer le prix et vendre les jetons de manière à ce que la rentabilité soit favorable et durable ?
Il n'existe pas de modèle économique unique qui établit la meilleure façon de monétiser les jetons. Quatre stratégies-clés ont émergé, chacune adaptée à différents contextes commerciaux et points de départ.
Les mécanismes de tarification énumérés ci-dessous sont basés sur la vente directe des jetons. L'approche est conceptuellement similaire pour les produits et services basés sur des jetons, sauf que les entreprises doivent également tenir compte de la valeur ajoutée qu'elles fournissent au client final.
Il est essentiel de bien définir les fondamentaux de la tarification, quel que soit le modèle adopté par chaque entreprise.
Comment déterminer le prix des jetons
Au moment de fixer le prix des jetons, vous devez prendre en compte trois facteurs importants :
Au final, les revenus tirés des jetons dépendent de la production de jetons, du prix des jetons et de la distribution de la demande entre les niveaux de tarification. Les marges bénéficiaires dépendent du coût de production des jetons. Les décisions d'infrastructure sont donc directement pertinentes pour les revenus. La plateforme NVIDIA Vera Rubin augmente le débit et divise par dix le coût par jeton. En outre, la plateforme Vera Rubin avec LPX permet de débloquer des charges de travail hautement interactives et hautement intelligentes à des prix premium, augmentant ainsi à la fois les opportunités de revenus et les marges au sommet de la gamme de tarification.
Les études de cas suivantes illustrent comment les entreprises mettent en pratique les stratégies exposées dans ce guide pour chacun de ces quatre modèles : vente directe de jetons, élaboration d'offres d'IA native, amélioration de produits et de services existants, et transformation des opérations internes. Les valeurs de performance et d'efficacité présentées précédemment dans ce guide soulignent ce qui est possible de réaliser grâce à l'adoption d'une philosophie de co-conception intégrale. Les études de cas ci-dessous présentent des entreprises à différentes étapes de ce parcours. Les résultats dévoilés témoignent d'une combinaison spécifique de sélection de modèles, de longueurs de séquence, de précision numérique, d'optimisations d'inférence et de matériel déployé.
Sommaire
Cohere, fondée en 2019, est une entreprise souveraine de premier plan qui fournit des modèles de fondation et des produits de bout en bout pour résoudre des problèmes commerciaux concrets. Cohere travaille sur les deux côtés de l'économie des jetons : elle crée ses propres modèles et elle conçoit les produits et les solutions qui utilisent ces modèles. La principale gamme de grands modèles de langage (LLM) de Cohere repose sur la série de modèles Command/North, notamment Command A Vision (modèle multimodal) et Command A Translate, ainsi que Embed et Rerank pour la recherche.
Cohere a également développé North, un espace de travail d'IA d'entreprise sécurisé grâce auquel les employés travaillent aux côtés d'agents d'IA personnalisables qui effectuent des recherches dans les données d'entreprise avec la génération augmentée par récupération (RAG), utilisent des outils, exécutent des workflows et alimentent des automatisations.
Objectif
Étant donné que North fonctionne sur les propres modèles de Cohere, et que chaque interaction est à la fois gourmande en jetons et sensible à la latence, l'efficacité de l'inférence stimule directement les marges de Cohere et la qualité des produits. De ce fait, Cohere a besoin de la meilleure infrastructure d'IA possible pour fournir le coût par jeton le plus bas, réduire la latence et atteindre un débit par nœud suffisamment élevé. Cohere exécute un programme de benchmarking continu pour les modèles, le matériel et les niveaux de charge.
Solution
Cohere a fait passer ses modèles de production du NVIDIA H100 vers les GPU NVIDIA Blackwell B200 et GB200, généralement exécutables avec le niveau de précision FP8.
Résultats
Dans les propres benchmarks internes de Cohere comparant les GPU NVIDIA H100 et NVIDIA B200, l'équipe a constaté que :
Graphique à barres montrant le gain de débit maximal avec B200 par rapport à H100 (jusqu'à 64 utilisateurs).
Les gains techniques génèrent de la valeur commerciale
Un débit par nœud plus élevé et une latence plus faible se traduisent par des marges bénéficiaires significatives et un produit de meilleure qualité.
Dans l'ensemble, Cohere a obtenu de meilleures marges, une plus grande évolutivité, une plus grande flexibilité et une meilleure expérience client en fournissant ses modèles et ses solutions sur NVIDIA Blackwell.
À titre d'illustration, le tableau ci-dessous montre l'impact commercial général que Cohere a obtenu grâce à NVIDIA Blackwell.
Remarque : le débit mesuré est combiné aux prix des GPU disponibles publiquement pour illustrer la forme de l'impact, et non les coûts réels supportés par Cohere.
Coût illustratif par million de jetons (même nombre de GPU ; 3,50 $/H100-heure à titre indicatif et 6 $/B200-heure = prix majoré par 1,71 fois).
| Modèle (scénario) | H100 Coût par million de jetons | B200 Coût par million de jetons | Gain de débit | Jetons par dollar |
|---|---|---|---|---|
| Command A Translate (1K/100) | 0,39 $ | 0,26 $ | 2,62x | +53% (-35% cost) |
| Command A+ (10K/1K) | 128$ | 113$ | 1,93x | +13% (-11% cost) |
| Command A Vision (1 image) | 1,99 $ | 1,83 $ | 1,87x | +9% (-8% cost) |
Gain de jetons par dollar = gain de débit / prix GPU majoré. Avec un débit supérieur d'environ 1,7 fois (contexte long, haute concurrence, traduction), NVIDIA Blackwell permet de réaliser des économies réelles en termes de coût par jeton. L'avantage se renforce à mesure que l'écart de prix B200/H100 se réduit (les taux de Cloud sont souvent proches de 1,5 fois).
Sommaire
Perplexity est une plateforme d'agents d'IA axée sur une IA précise. La plateforme de l'entreprise tire parti de 15 modèles d'IA, notamment NVIDIA Nemotron 3 Ultra, de manière à acheminer chaque charge de travail via le pipeline vers le modèle présentant le meilleur rapport qualité-prix afin d'optimiser les performances, la qualité et les coûts pour les clients.
"Chaque génération de matériel NVIDIA nous a fourni quelque chose de spécifique. NVIDIA Hopper nous a permis de servir notre flotte de modèles. NVIDIA Blackwell, avec le domaine NVLink élargi et le niveau de précision MXFP8 sur les cœurs Tensor, nous permet de faire fonctionner le service sur plusieurs nœuds sans impacter la latence. C'est tout ceci qui rend les charges de travail économiquement viables." – Denis Yarats, cofondateur et directeur de la technologie, Perplexity
Objectif
L'objectif commercial de Perplexity est de fournir une IA précise et évolutive pour le grand public tout en préservant la rentabilité nécessaire pour atteindre une fiabilité et une croissance adaptées aux entreprises. L'infrastructure de production de Perplexity traite déjà plus de 50 millions de requêtes par jour sur un parc de 15 modèles, correspondant à un délai du 50e percentile jusqu'au premier jeton (P50 TTFT), allant d'un délai de recherche rapide d'environ 2,4 secondes jusqu'à environ 13 secondes pour le raisonnement profond. À mesure que davantage de ce trafic se transforme en un processus d'IA agentique de plusieurs heures sur Perplexity Computer, Perplexity rend chaque unité d'intelligence plus abordable, plus rapide et plus fiable, de sorte que les coûts et la latence évoluent subtilement avec le trafic et la complexité des tâches.
Solution
L'infrastructure d'IA de Perplexity est basée sur plusieurs générations de matériel NVIDIA, notamment NVIDIA Hopper et NVIDIA Blackwell, et elle est orchestrée et optimisée avec la pile logicielle pour les Data Centers de NVIDIA.
Perplexity a conçu sa pile d'inférence sur NVIDIA pour réduire le coût par jeton sans sacrifier la précision ou la latence. Les performances de chaque génération de GPU successive s'améliorent considérablement et, lorsqu'elles sont associées à FlashInfer, CuTe DSL, SHARP, la quantification MXFP8 ainsi qu'à un pré-remplissage et à un décodage désagrégés, elles sont capables d'extraire plus de jetons par heure d'utilisation GPU.
Résultats
Perplexity a permis de multiplier par environ 2 à 4 le coût par jeton de sortie sur une configuration GB200 multi-nœuds par rapport à une instance H200 mono-nœud, tout en réduisant la latence de distribution de 46,5 % pour les modèles MoE.
Réduction de la latence
Le graphique ci-dessous compare la latence de distribution MoE entre les H200 et GB200 utilisant NVLink et les transports NVLS, ce qui démontre que GB200 avec NVLS réduit la latence de distribution de 46,5 % par rapport à H200 avec NVLS (313,3 μs contre 586,1 μs).
Perplexity
Amélioration du débit
Le graphique suivant représente le débit de décodage par GPU par rapport à la vitesse de décodage pour GB200 (EP = 4/8/16) et H200 (EP = 8/16), montrant que les déploiements multi-nœuds GB200 atteignent un débit par GPU 2 à 4 fois supérieur à celui d'un H200 mononœud aux vitesses de décodage correspondantes, en partie grâce au domaine NVLink élargi.
Perplexity
Sommaire
La mission de Canva est de permettre au monde entier de s'adonner à la création. La suite d'outils de conception IA de Canva peut aider chaque personne à fournir le meilleur d'elle-même, avec des outils qui facilitent le processus de création ; des publications sur les réseaux sociaux jusqu'aux présentations en passant par de courtes vidéos. Parmi les fonctionnalités les plus populaires de sa suite Design figure le générateur d'IA pour la conversion d'images en vidéos, qui transforme une photo fixe en un court clip animé ne nécessitant aucun logiciel et fonctionnant sur n'importe quel appareil.
"Travailler avec NVIDIA permet à Canva d'améliorer l'efficacité des expériences créatives alimentées par l'IA, telles que les workflows image-vers-vidéo, tout en préservant la vitesse et la qualité que nos utilisateurs attendent. Cette efficacité est essentielle pour rendre nos outils de création avancés accessibles au plus grand nombre." – Stefano Corazza, responsable de la recherche en IA, Canva
Objectif
Canva compte actuellement plus de 265 millions d'utilisateurs actifs par mois, ce qui en fait l'une des trois applications d'IA les plus utilisées au monde. Pour rendre son générateur d'IA populaire de conversion d'images en vidéos accessible à tout le monde, Canva a déployé une infrastructure d'inférence spécialisée alimentée par NVIDIA. Cela garantit que les vidéos générées répondent aux normes les plus élevées du secteur tout en maintenant le coût par génération et la latence à des niveaux raisonnables.
Solution
Canva exécute sa pile d'inférence image-vers-vidéo sur du matériel NVIDIA pour réduire le coût par génération sans sacrifier la précision ou la latence. La fonctionnalité est alimentée par un modèle vidéo à transformateur de diffusion mis en œuvre sur des GPU NVIDIA B200. Grâce à des pipelines d'inférence distribués et de post-traitement optimisés, combinés à des noyaux matériels spécialisés, Canva fournit davantage de vidéos générées par heure d'utilisation GPU, permettant ainsi d'offrir une expérience gratuite de conversion d'images en vidéos à une base d'utilisateurs mondiale.
Résultats
Canva a pu réaliser 70 % de générations de vidéos supplémentaires par heure d’utilisation GPU sur les B200 par rapport aux H200.
Comment utiliser cette feuille de calcul : remplissez chaque champ [_blank_] avec le numéro approprié. Les résultats de chaque couche sont alimentés dans la couche suivante. Les résultats de chaque section dévoilent comment les données sont multipliées et comment les chiffres s'ajoutent en cascade.
Couche 1 : demande de base
Nous dimensionnons ce déploiement pour les [__________] utilisateurs, chacun exécutant environ [__________] tâches par jour. Une requête-type envoie [__________] jetons d'entrée, et le modèle renvoie [__________] jetons de sortie.
Entrées
A. Utilisateurs ......................... [__________]
B. Tâches quotidiennes par utilisateur ........ [__________]
C. Longueur de la séquence d'entrée (ISL) ...... [__________] jetons
D. Longueur de la séquence de sortie (OSL) ...... [__________] jetons
Modalités de calcul
Sessions/jour = A × B
= [_____] × [_____]
= [_______________] sessions/jour
Jetons/demande = C + D
= [_____] + [_____]
= [_______________] jetons/demande
Jetons de base/jour = Sessions × Jetons/requête
= [_____] × [_____]
= [_______________] jetons/jour
Jetons de base/mois = Valeur quotidienne × 30
= [_______________] jetons/mois
Couche 2 : multiplicateurs de charge de travail
Chaque étape consomme environ [__________] jetons de raisonnement cachés, et une seule tâche est composée de [_____] étapes d'agent en chaîne. Les défaillances et les récupérations ajoutent une [_____]× charge de reprise, et nous associons une invite de système de jetons [__________] à chaque appel. La mise en cache des requêtes atteint [_____] % des jetons de requête pour le système.
Entrées
E. Jetons de raisonnement par étape ....... [__________]
F. Étapes d'agent par tâche ............ [_____]
G. Multiplicateur de reprise ................ [_____] ×
H. Jetons de requête système par étape... [__________]
I. Taux de réussite du cache .................. [_____] %
Modalités de calcul
Jetons ajustés/demande = Jetons/requête + E
= [_____] + [_____]
= [_______________]
Jetons/tâche (avec des étapes) = Valeur ajustée × F
= [_____] × [_____]
= [_______________]
Jetons/tâche (avec reprises) = Au-dessus × G
= [_____] × [_____]
= [_______________]
Économies de mise en cache/jour = H × (I / 100) × F × Sessions
= [_____] × [_____] × [_____] × [_____]
= [_______________] jetons économisés/jour
Jetons effectifs/jour = (Jetons/tâche × sessions) − Économies de mise en cache
= [_____] − [_____]
= [_______________] jetons/jour
Jetons effectifs/mois = Valeur quotidienne × 30
= [_______________] jetons/mois
Couche 3 : façonnage opérationnel
Environ [_____] % du trafic quotidien se joue dans une fenêtre commerciale de [_____] heures. Lors de ce pic, le trafic réel atteint [_____]× la moyenne fenêtre, et les pics saisonniers génèrent un trafic supplémentaire de [_____]×. Pour respecter les SLA en matière de latence, maintenez une marge supplémentaire de [_____]×.
Entrées
J. Concentration maximale aux heures de pointe ......... [_____] %
K. Heures de fenêtre de pointe ............... [_____] heures
L. Taux de rafale ................. [_____] ×
M. Facteur de pics saisonniers ........... [_____] ×
N. Marge de latence SLA ............ [_____] ×
Modalités de calcul
Moyenne de jetons par minute (sur 24 heures) = Efficacité quotidienne ÷ 1 440
= [_____] ÷ 1 440
= [_______________] jetons/min
Moyenne de jetons par minute (fenêtre de pointe) = (Efficacité quotidienne × J/100) ÷ (K ×
60) ([_____] × 60)
= [_____________] jetons/min
Moyenne de jetons par minute (taux de rafale) = Pic de jetons par minute ×
L [_____
] [_____________] jetons/min
Pic de jetons par minute + SLA = Rafale ×
N [_____] [_____] [_____
] [_______] jetons/min
Pic de jetons par minute + valeur saisonnière = Au-dessus × ×
M
La tokénomie avec NVIDIA vise à optimiser le coût et les revenus de la génération de jetons d'IA par watt, dans le but de réduire le coût global par jeton grâce à des architectures telles que NVIDIA Blackwell et Vera Rubin. Pour discuter de la tarification des infrastructures ou de l'octroi de licences logicielles, vous pouvez nous contacter via le formulaire ci-dessous.