White Paper
A IA funciona com tokens. A forma como você os usa, escala, gera e monetiza determina sua vantagem competitiva em IA. Selecione o modelo e o tamanho de contexto ideais para cada caso de uso, implante uma infraestrutura que maximize os tokens por watt e minimize o custo por token e impulsione o crescimento da receita e da margem em escala.
Os data centers estão se tornando fábricas de tokens de IA. Onde antes processavam transações e serviam páginas da web, agora fabricam um novo tipo de resultado: tokens, a unidade de inteligência produzida por modelos de IA durante a inferência. À medida que a IA passa da experimentação para a produção, a inferência se tornou a carga de trabalho dominante, e os tokens se tornaram a nova mercadoria que as empresas devem aprender a produzir, gerenciar e monetizar.
O que é tokenomics? É a economia da geração e do uso de tokens e um termo usado com frequência pelo ecossistema, mas que pode carecer de precisão. Para entender melhor o que tokenomics realmente significa, é útil pensar no conceito em termos de como os tokens são valorizados, consumidos, fornecidos e monetizados.
Tokenomics abrange quatro pilares interconectados:
Cada pilar de tokenomics não existe de forma isolada. As decisões sobre a oferta afetam diretamente as margens, as previsões de demanda determinam os requisitos de infraestrutura e a utilidade dos tokens define o limite do que pode ser cobrado. Esses quatro pilares são profundamente interdependentes, e utilizá-los corretamente é o que separa as empresas de IA sustentáveis de experimentos caros. Este artigo explora cada um em profundidade, fornecendo uma estrutura para empresas que planejam ou escalam implantações de IA.
Nem todos os tokens são criados de forma igual. O valor de um token depende de duas dimensões:
Quanto maior a inteligência e mais rápida a interatividade, maior o custo de produção desses tokens. Mas o valor obtido com esses tokens varia de acordo com o caso de uso e depende inteiramente da capacidade de aproveitá-los. Um pequeno modelo de linguagem (SLM) pós-treinado pode igualar ou superar um modelo muito maior e mais inteligente para tarefas específicas de domínio, por uma fração do custo. Um pipeline de processamento de documentos em lote tem requisitos de interatividade muito diferentes de um assistente de programação em tempo real. O valor adicional só vale a pena pagar se a aplicação puder usá-lo.
A utilização de tokens é melhor entendida como um espectro: desde cargas de trabalho de alto processamento e menor interação, atendidos por SLMs básicos ou pós-treinados, como pesquisa e chatbot, até cargas de trabalho em tempo quase real, que exigem os maiores modelos com o contexto mais longo, como programação e automação baseadas em agentes. A tarefa estratégica é mapear cada caso de uso para o ponto certo nesse espectro.
Uma abordagem prática é primeiro prototipar e validar com capacidade de ponta, depois definir objetivos rigorosos de nível de serviço (SLOs) por meio de avaliações e, por fim, otimizar e dimensionar adequadamente para operar em escala. Perguntas que ajudam a orientar esse processo incluem:
Obter esse mapeamento corretamente tem consequências diretas para o processo posterior. Ele determina quais modelos são implantados, como dimensionar as necessidades de infraestrutura e, por fim, quanto cobrar pelos tokens produzidos. A utilidade de tokens é a base na qual as decisões de demanda, oferta e monetização são criadas.
A infraestrutura de IA da NVIDIA oferece aos clientes a flexibilidade de escolher o valor ideal dos tokens, com suporte a uma ampla variedade de modelos proprietários e de pesos abertos. A NVIDIA também desenvolve o Nemotron, uma família de modelos abertos e multimodais altamente eficientes, criados para agentes de longa execução e autoevolutivos. Por exemplo, o Nemotron 3 Ultra concluiu os benchmarks de programação usando menos tokens totais e menos tokens por turno do que modelos comparáveis, reduzindo o custo para tarefas baseadas em agentes em até 30%.
Como você prevê a demanda de tokens? Começar com o caso de uso é a maneira mais eficaz de usar a demanda como uma ferramenta de previsão e planejamento de infraestrutura. O mercado está experimentando uma expansão agressiva de casos de uso, desde chatbots para consumidores e empresas até programação e automação baseada em agentes. Essa mudança está transformando rapidamente o cenário de demanda, passando de um mercado de trilhões de tokens para quadrilhões, alterando fundamentalmente a carga de trabalho, as características da demanda por tokens e seu custo unitário.
As empresas precisam de metodologias para prever a própria demanda a fim de planejar os investimentos e as despesas operacionais associados aos seus casos de uso de IA. A abordagem baseada em princípios fundamentais consiste em três níveis:
Um modelo de previsão da demanda de tokens em três camadas, desde estimativas de base, passando por multiplicadores de carga de trabalho, até variáveis de demanda operacional que definem os requisitos de infraestrutura no mundo real. O modelo de três níveis usa um código de cores: verde indica componentes compartilhados com o planejamento de capacidade de software tradicional, e laranja destaca variáveis exclusivas do fornecimento de tokens (tokens por solicitação, raciocínio e loops de agentes).
As estimativas de demanda baseadas no nível 1 são o ponto de partida para o planejamento de capacidade. Elas servem como uma referência inicial para compreender os requisitos de implantações de prova de conceito, mas raramente são suficientes para escalar para produção. Os multiplicadores de demanda da carga de trabalho podem aumentar a demanda de tokens em uma ordem de grandeza. Como mostra o exemplo abaixo, se a infraestrutura fosse provisionada apenas com base na estimativa de demanda base, a aplicação associada teria um déficit de mais de 600 milhões de tokens por dia.
As considerações de demanda operacional (camada 3) exigem demanda de modelagem em um nível mais granular. Esta planilha de previsão da demanda de tokens oferece um modelo com campos a serem preenchidos para orientar você pelos três níveis.
A previsão da demanda por tokens não é tão diferente do planejamento tradicional de capacidade de software. A maioria das entradas — sessões, solicitações, repetições, taxas de acerto de cache, padrões temporais e acordos de nível de serviço (SLAs) de latência — é compartilhada com práticas que as equipes de infraestrutura já conhecem. Três variáveis são exclusivas do fornecimento de tokens: tokens por solicitação, sobrecarga de raciocínio e loops de agentes. O que diferencia o perfil de demanda entre uma implantação e outra não é a metodologia, mas o contexto: o caso de uso, a organização que está implantando e as decisões de projeto da aplicação incorporadas no workflow.
As organizações que tratarem esses três níveis como um modelo dinâmico, e não como um exercício pontual, estarão mais bem posicionadas para dimensionar adequadamente a infraestrutura à medida que as cargas de trabalho baseadas em agentes ganham escala e a demanda de tokens aumenta de forma cumulativa.
A oferta de tokens se trata fundamentalmente de eficiência: maximizar a produção de tokens, ao mesmo tempo em que minimiza o custo de produção de tokens.
Alcançar isso requer a co-otimização da eficiência dos modelos, da eficiência do sistema e da eficiência do software. Nenhum componente único é suficiente por si só. Os três devem ser projetados juntamente com o ecossistema. A NVIDIA chama isso de "codesign extremo", que abrange modelos e algoritmos, computação, redes, memória, armazenamento, software e o ecossistema de parceiros e clientes, com cada componente trabalhando em conjunto para tornar o todo maior do que a soma das partes e permitir que o sistema gere tokens pelo menor custo possível.
Eficiência de Modelos
As arquiteturas de mistura de especialistas (MoE) oferecem ganhos significativos na eficiência dos modelos, ativando apenas os parâmetros relevantes para cada token. Por exemplo, a Kimi K2.5 tem 1 trilhão de parâmetros, mas ativa apenas 32 bilhões por token, oferecendo a inteligência de um modelo denso muito maior por uma fração do custo de computação. O custo oculto é a comunicação entre especialistas espalhados por GPUs. A inferência de MoE gera um intenso tráfego all-to-all entre GPUs nos diferentes lotes, e os ganhos de eficiência desaparecem se o sistema subjacente não conseguir lidar com esse tráfego em escala.
Eficiência do Sistema
A NVIDIA GB200 NVL72 conecta 72 GPUs por meio do Switch NVIDIA NVLink, permitindo 1.800 gigabytes por segundo (GB/s) de largura de banda all-to-all. Esse domínio maior de GPUs permite distribuir os especialistas entre até 72 GPUs sem os gargalos de comunicação que limitam configurações de malha fixa e nó único ou abordagens de scale-up baseadas em Ethernet disponíveis no mercado. Isso garante que a eficiência teórica dos modelos MoE seja alcançada na produção.
Eficiência do Software
Aproveitar todo o potencial do hardware requer um stack de software otimizado em três camadas de arquitetura: acesso à infraestrutura, aceleração de aplicações, orquestração e entrega. A NVIDIA oferece um stack de software robusto que pode permitir todas as otimizações simultaneamente. Isso é mais difícil do que parece, mas é o efeito cumulativo que produz melhorias significativas na quantidade de tokens fornecidos. As otimizações contínuas de software pelo ecossistema de código aberto e pela NVIDIA tornam o hardware existente mais produtivo ao longo do tempo.
O resultado do design conjunto extremo é o menor custo por token no setor com a GB200 NVL72.
Otimização Dentro das Restrições Empresariais
A maioria das empresas precisa otimizar o custo dos tokens dentro da infraestrutura existente do data center e das restrições do ambiente. Por exemplo, a densidade de energia média do rack é de cerca de 27 quilowatts (kW) e 75% dos data centers ainda têm resfriamento a ar, em vez de resfriamento a água. As empresas também costumam ter cargas de trabalho mistas além da IA, como processamento de dados ou gráficos, e disponibilidade limitada de capital inicial para lidar com essas restrições. A NVIDIA oferece opções de adaptação específicas. A NVIDIA HGX™ B200 e B300 oferecem o menor custo de tokens para fábricas de IA com resfriamento a ar. A NVIDIA RTX PRO™ 6000 Blackwell oferece até 3 vezes a eficiência de tokens dos sistemas NVIDIA Hopper™ da geração anterior para cargas de trabalho de inferência empresarial.
Eficiência de Geração de Tokens
Taxa de Processamento por Megawatt e Custo por Token: as Métricas Importantes
A maioria das organizações ainda avalia a infraestrutura de IA usando métricas de entrada, como custo por hora de GPU, pico de operações de ponto flutuante por segundo (FLOPS) ou FLOPS por dólar. Essas são as métricas erradas para avaliar a infraestrutura de IA. Quatro medições comparando a NVIDIA Blackwell e a Hopper exemplificam isso:
As métricas que mais importam são a taxa de processamento por MW e o custo por token.
A taxa de processamento por MW impacta sua receita, e o custo por token determina a lucratividade por interação e a rapidez com que uma empresa pode crescer. Essas métricas capturam o desempenho do hardware, a otimização do software e a utilização em situações reais em uma única métrica. Para uma análise mais aprofundada do custo total de propriedade da inferência, consulte Repensando o TCO da IA: por que o custo por token é a única métrica que importa.
À medida que a IA baseada em agentes amadurece, ideias adjacentes estão surgindo juntamente com o custo por token: inteligência por token, tokens por tarefa e custo por tarefa. O custo por tarefa é uma função da eficiência com que um modelo gera inteligência (inteligência por token) e da eficiência com que um modelo usa tokens para concluir uma tarefa (tokens por tarefa).
A utilidade define o valor de um token. A demanda prevê quantos tokens serão consumidos e por quem. A oferta decide quanto custa para produzir esses tokens.
A monetização reúne esses três pilares e responde à pergunta central de negócios: como você define o preço e vende tokens para que a economia seja favorável e sustentável?
Não existe um único modelo econômico para monetizar tokens. Quatro estratégias principais surgiram, cada uma adequada a diferentes contextos de negócios e pontos de partida.
A mecânica de precificação a seguir é baseada na venda direta de tokens. Para produtos e serviços criados com base em tokens, a abordagem é conceitualmente semelhante, embora as organizações também devam levar em conta o valor adicional que estão oferecendo ao cliente final.
Acertar os fundamentos da precificação é essencial, independentemente do modelo adotado pela organização.
Como Determinar o Preço de Tokens
Ao precificar os tokens, considere três fatores importantes:
Em última análise, a receita gerada por tokens depende da quantidade de tokens fornecidos, do preço dos tokens e da distribuição da demanda entre os níveis de preços. As margens de lucro dependem do custo de produzir tokens. As decisões de infraestrutura são, portanto, diretamente relevantes para a receita. A plataforma NVIDIA Vera Rubin aumenta a taxa de processamento e reduz o custo por token em dez vezes. Além disso, a Vera Rubin com LPX desbloqueia cargas de trabalho de alta interatividade e alta inteligência que podem ser comercializadas a preços premium, expandindo as oportunidades de receita e as margens no topo do espectro de preços.
Os estudos de caso a seguir ilustram como as organizações estão colocando essas estratégias em prática em cada um dos quatro modelos: venda de tokens diretamente, criação ofertas nativas de IA, aprimoramento de produtos e serviços existentes, transformação das operações internas. Os números de desempenho e eficiência apresentados anteriormente neste guia destacam o que é possível alcançar com o codesign completo. Os estudos de caso a seguir mostram organizações em diferentes estágios dessa jornada, com resultados que refletem suas combinações específicas de seleção de modelos, comprimentos de sequência, precisão numérica, otimizações de inferência e hardware implantado.
Resumo
A Cohere, fundada em 2019, é uma empresa líder em IA soberana que desenvolve modelos fundacionais e produtos de ponta a ponta para solucionar problemas de negócios do mundo real. A Cohere trabalha em ambos os lados da economia de tokens: desenvolve seus próprios modelos e cria os produtos e soluções que usam esses modelos. A principal família de grandes modelos de linguagem (LLMs) da Cohere é a família de modelos Command/North, incluindo Command A Vision (multimodal) e Command A Translate, além de Embed e Rerank para pesquisa.
A Cohere também desenvolveu o North, um espaço de trabalho de IA empresarial seguro, no qual os funcionários trabalham ao lado de agentes de IA personalizáveis que pesquisam dados da empresa com RAG, usam ferramentas, executam workflows e impulsionam automações.
Objetivo
Como o North é executado nos próprios modelos da Cohere, cada interação consome muitos tokens e é sensível à latência. Por isso, a eficiência da inferência afeta diretamente as margens da Cohere e a qualidade do produto. Devido a isso, a Cohere precisa da melhor infraestrutura de IA para fornecer o menor custo por token, reduzir a latência e alcançar alta taxa de processamento por nó. A Cohere mantém um programa contínuo de benchmarking de modelos, hardware e níveis de carga.
Solução
A Cohere migrou seus modelos de produção da NVIDIA H100 para a NVIDIA Blackwell B200 e GB200, geralmente executados com precisão FP8.
Resultados
Nos benchmarks internos da Cohere, comparando a NVIDIA H100 com a NVIDIA B200, a equipe encontrou:
Gráfico de barras mostrando o ganho máximo de taxa de processamento da B200 em relação à H100 em testes equivalentes (até 64 usuários).
Ganhos Técnicos Geram Valor para os Negócios
Uma maior taxa de processamento por nó e uma menor latência se convertem em margens e em um produto melhor.
No geral, a Cohere obteve melhores margens, maior escala, maior flexibilidade e uma melhor experiência para o cliente ao oferecer seus modelos e soluções na plataforma NVIDIA Blackwell.
Para ilustrar, a tabela abaixo mostra o impacto geral nos negócios que a Cohere alcançou com a NVIDIA Blackwell.
Observação: a taxa de processamento medida é combinada com os preços de GPU disponíveis publicamente para ilustrar a forma do impacto, e não os custos reais da Cohere.
Custo ilustrativo por 1 milhão de tokens (mesma quantidade de GPUs; valores ilustrativos de US$ 3,50/hora para H100 e US$ 6,00/hora para B200 = preço 1,71 vez maior).
| Modelo (Cenário) | Custo H100 por 1 milhão de tokens | Custo B200 por 1 milhão de tokens | Ganho de taxa de transferência | Tokens por Dólar |
|---|---|---|---|---|
| Command A Translate (1K/100) | US$ 0,39 | US$ 0,26 | 2,62x | +53% (-35% de custo) |
| Command A+ (10K/1K) | US$ 0,128 | US$ 0,113 | 1,93x | +13% (-11% de custo) |
| Command A Vision (1 imagem) | US$ 1,99 | US$ 1,83 | 1,87x | +9% (-8% de custo) |
Ganho de tokens por dólar = ganho de taxa de processamento / preço adicional da GPU. Acima de ~1,7 vezes a taxa de processamento (contexto longo, alta concorrência, tradução), a NVIDIA Blackwell gera uma redução real no custo por token. A vantagem cresce à medida que a diferença de preço da B200/H100 diminui (as taxas de nuvem geralmente estão mais próximas de 1,5 vez).
Resumo
A Perplexity é uma plataforma de agentes de IA focada em IA precisa. A plataforma da empresa utiliza 15 modelos de IA, incluindo o NVIDIA Nemotron™ 3 Ultra, encaminhando cada carga de trabalho pelo pipeline até o modelo com a melhor relação entre custo e qualidade para otimizar o desempenho, a qualidade e o custo para nossos clientes.
"Todas as gerações de hardware da NVIDIA nos trouxeram algo específico. A NVIDIA Hopper nos permitiu atender à demanda do nosso conjunto de modelos. A NVIDIA Blackwell, com o domínio NVLink maior e MXFP8 nos Núcleos Tensores, permite atender a essa demanda em vários nós sem comprometer a latência. É isso que torna economicamente viáveis as cargas de trabalho para as quais estamos migrando." — Denis Yarats, cofundador e CTO da Perplexity
Objetivo
O objetivo de negócios da Perplexity é oferecer IA precisa em escala de consumo e, ao mesmo tempo, preservar a viabilidade econômica necessária para garantir confiabilidade e crescimento de nível empresarial. A infraestrutura de produção da Perplexity já processa mais de 50 milhões de consultas por dia em um conjunto de 15 modelos, com tempo até o primeiro token no percentil 50 (P50 TTFT) variando de 2,4 segundos em pesquisas rápidas a cerca de 13 segundos em tarefas de raciocínio profundo. À medida que uma parcela maior desse tráfego migra para tarefas baseadas em agentes que duram várias horas no Perplexity Computer, a Perplexity torna cada unidade de inteligência mais barata, rápida e confiável, para que o custo e a latência aumentem de forma sublinear em relação ao tráfego e à complexidade das tarefas.
Solução
A infraestrutura de IA da Perplexity é baseada em várias gerações de hardware da NVIDIA, incluindo NVIDIA Hopper e NVIDIA Blackwell, e é orquestrada e otimizada com a pilha de software para data centers da NVIDIA.
A Perplexity criou seu stack de inferência com tecnologia NVIDIA para reduzir o custo por token sem sacrificar a precisão ou a latência. O desempenho melhora significativamente a cada nova geração de GPUs e, quando combinadas com FlashInfer, CuTe DSL, SHARP, quantização MXFP8 e fornecimento desagregado de pré-preenchimento e decodificação, essas tecnologias permitem extrair mais tokens por hora de GPU.
Resultados
A Perplexity obteve uma redução de aproximadamente 2 a 4 vezes no custo dos tokens de saída com a GB200 em vários nós em comparação com a H200 em um único nó, além de reduzir a latência de despacho em 46,5% nos modelos MoE.
Latência Reduzida
O gráfico abaixo compara a latência de despacho MoE entre H200 e GB200 usando os transportes NVLink e NVLS, mostrando que a GB200 com NVLS reduz a latência de despacho em 46,5% em comparação com a H200 com NVLS (313,3 μs versus 586,1 μs).
Perplexity
Taxa de Processamento Aprimorada
O próximo gráfico apresenta a taxa de processamento de decodificação por GPU em relação à velocidade de decodificação para GB200 (EP = 4/8/16) e H200 (EP = 8/16), mostrando que as implantações da GB200 em vários nós alcançam uma taxa de processamento por GPU de 2 a 4 vezes maior em comparação com a H200 em um único nó com velocidades de decodificação equivalentes, graças ao domínio NVLink maior.
Perplexity
Resumo
A missão do Canva é capacitar o mundo a criar designs. O pacote de ferramentas de IA para design do Canva pode ajudar qualquer pessoa a fazer seu melhor trabalho, desde postagens em mídias sociais até apresentações e vídeos curtos. Entre os recursos mais populares do pacote de design do Canva está o gerador de IA de imagem para vídeo, que transforma uma foto estática em um pequeno clipe animado, sem exigir software e funcionando em qualquer dispositivo.
"Trabalhar com a NVIDIA ajuda o Canva a melhorar a eficiência das experiências criativas com tecnologia de IA, como a conversão de imagem em vídeo, preservando a velocidade e a qualidade que nossos usuários esperam. Essa eficiência é fundamental para tornar ferramentas criativas avançadas acessíveis a mais pessoas." – Stefano Corazza, Diretor de Pesquisa de IA, Canva
Objetivo
Atualmente, o Canva tem mais de 265 milhões de usuários ativos mensais, o que o torna um dos três aplicativos de IA mais usados do mundo. Para disponibilizar para todos o popular gerador de IA de imagem para vídeo, o Canva criou uma infraestrutura de inferência especializada com tecnologia NVIDIA. Isso garante que os vídeos gerados atendam aos mais altos padrões do setor, mantendo o custo por geração e a latência em níveis razoáveis.
Solução
O Canva executa seu stack de inferência de imagem para vídeo com tecnologia NVIDIA para reduzir o custo por geração sem sacrificar a precisão ou a latência. O recurso utiliza um modelo de vídeo diffusion transformer, executado em GPUs NVIDIA B200. Graças a pipelines otimizados de inferência distribuída e pós-processamento, combinados com kernels especializados para o hardware, o Canva gera mais conteúdo de vídeo por hora de GPU, permitindo escalar a experiência gratuita de conversão de imagem em vídeo para uma base global de usuários.
Resultados
O Canva foi capaz de alcançar 70% mais gerações de vídeo por hora de GPU em B200s em comparação com H200s.
Como usar esta planilha: preencha cada [_blank_] com o número apropriado. As saídas de cada camada são transferidas para a próxima camada. Os cálculos em cada seção mostram exatamente o que está sendo multiplicado e como os números se propagam.
Camada 1: Demanda de Base
Estamos dimensionando esta implantação para [__________] usuários, cada um executando cerca de [__________] tarefas todos os dias. Uma solicitação típica envia [__________] tokens de entrada, e o modelo retorna [__________] tokens de saída.
Entradas
A. Usuários ......................... [__________]
B. Tarefas por usuário por dia ........ [__________]
C. Comprimento da sequência de entrada (ISL) ...... [__________] tokens
D. Comprimento da sequência de saída (OSL) ...... [__________] tokens
Os cálculos
Sessões / Dia = A × B
= [_____] × [_____]
= [_______________] sessões/dia
Tokens / Solicitação = C + D
= [_____] + [_____]
= [_______________] tokens/solicitação
Tokens Base / Dia = Sessions × Tokens/Solicitação
= [_____] × [_____]
= [_______________] tokens/dia
Tokens Base / Mês = Diário × 30
= [_______________] tokens/mês
Camada 2: Multiplicadores de Carga de Trabalho
Cada etapa consome cerca de [__________] tokens de raciocínio ocultos, e uma única tarefa passa por [_____] etapas de agentes. Falhas e alternativas adicionam uma sobrecarga de [_____]× devido a novas tentativas, e anexamos um prompt de sistema de [__________] tokens a cada chamada. O cache de prompts está atingindo [_____]% dos tokens do prompt de sistema.
Entradas
E. Tokens de raciocínio por etapa ....... [__________]
F. Etapas de agentes por tarefa ............ [_____]
G. Multiplicador de novas tentativas ............ [_____] ×
H. Tokens do prompt de sistema por etapa ... [__________]
I. Taxa de acerto de cache .................. [_____] %
Os cálculos
Tokens Ajustados / Solicitação = Tokens/Solicitação + E
= [_____] + [_____]
= [_______________]
Tokens / Tarefa (com etapas) = Ajustado × F
= [_____] × [_____]
= [_______________]
Tokens / Tarefa (com novas tentativas) = Acima × G
= [_____] × [_____]
= [_______________]
Economia de Cache / Dia = H × (I / 100) × F × Sessões
= [_____] × [_____] × [_____] × [_____]
= [_______________] tokens salvos/dia
Tokens Efetivos / Dia = (Tokens/Tarefa × Sessões) − Economias de Cache
= [_____] − [_____]
= [_______________] tokens/dia
Tokens Efetivos / Mês = Diário × 30
= [_______________] tokens/mês
Camada 3: Modelagem Operacional
Cerca de [_____]% do tráfego diário ocorre dentro de uma janela de horário comercial de [_____] horas. Dentro desse pico, o tráfego real aumenta para [_____]× a média da janela, e os picos sazonais aumentam esse valor em mais [_____]×. Para atender aos SLAs de latência, mantenha [_____]× de capacidade adicional.
Entradas
J. Concentração na hora de pico ......... [_____] %
K. Horas da janela de pico ............ [_____] horas
L. Taxa de pico ..................... [_____] ×
M. Fator de pico sazonal ........... [_____] ×
N. Capacidade adicional para o SLA de latência ............ [_____] ×
Os cálculos
TPM Médio (24 horas) = Diário Efetivo ÷ 1.440
= [_____] ÷ 1.440
= [_______________] tokens/min
TPM Médio (janela de pico) = (Diário Efetivo × J/100) ÷ (K × 60)
= ([_____] × [_____]) ÷ ([_____] × 60)
= [_______________] tokens/min
TPM de Pico de Tráfego = TPM de Pico × L
= [_____] × [_____]
= [_______________] tokens/min
TPM de Pico + SLA = Pico de Tráfego × N
= [_____] × [_____]
= [_______________] tokens/min
TPM de Pico + Sazonal = Acima × M
= [_____] × [_____]
= [_______________] tokens/min
O tokenomics da NVIDIA se concentra em otimizar o custo e a receita de geração de tokens de IA por watt, com o objetivo de reduzir o custo geral por token por meio de arquiteturas como NVIDIA Blackwell e Vera Rubin. Para discutir os preços de infraestrutura ou licenciamento de software, entre em contato utilizando o formulário abaixo.