Documento Técnico
La IA se ejecuta en tokens. La forma en que los usa, escala, genera y monetiza determina su ventaja competitiva de IA. Seleccione el modelo y la longitud de contexto óptimos para cada caso de uso, implemente una infraestructura que maximice los tokens por vatio y minimice el costo por token, e impulse el crecimiento de los ingresos y los márgenes a escala.
Los data centers se están convirtiendo en fábricas de tokens de IA. Donde una vez procesaron transacciones y sirvieron páginas web, ahora fabrican un nuevo tipo de resultado: tokens, la unidad de inteligencia producida por modelos de IA durante la inferencia. A medida que la IA pasa de la experimentación a la producción, la inferencia se ha convertido en la carga de trabajo dominante y los tokens se han convertido en el nuevo producto que las empresas deben aprender a producir, administrar y monetizar.
¿Qué es la tokenómica? Es la economía de la generación y el uso de tokens y es un término usado con frecuencia por el ecosistema, pero puede carecer de precisión. Para analizar en detalle lo que la tokenómica realmente significa, es útil enmarcarla como la forma en que los tokens se valoran, consumen, suministran y monetizan.
La tokenómica abarca cuatro pilares interconectados:
Cada pilar de la tokenómica no existe de forma aislada. Las decisiones sobre la oferta afectan directamente los márgenes, los pronósticos de la demanda determinan los requisitos de infraestructura y la utilidad de los tokens establece el límite máximo de lo que se puede cargar. Estos cuatro pilares son profundamente interdependientes, y lograrlos de forma correcta es lo que separa a las empresas de IA sostenibles de los experimentos costosos. Este documento explora cada uno en profundidad, proporcionando un framework para empresas que planifican o escalan implementaciones de IA.
No todos los tokens se crean iguales. El valor de un token depende de dos dimensiones:
Cuanto mayor sea la inteligencia y más rápida sea la interactividad, más costosos de producir serán los tokens. Pero el valor capturado a partir de estos tokens es relativo al caso de uso y depende completamente de si el caso de uso puede aprovecharlos o no. Un modelo de lenguaje pequeño (SLM) posentrenado puede igualar o exceder un modelo mucho más grande e inteligente para tareas específicas de dominio a una fracción del costo. Un pipeline de procesamiento de documentos por lotes tiene requisitos de interactividad muy diferentes de un asistente de codificación en tiempo real. Solo vale la pena pagar el valor adicional si la aplicación puede usarlo.
La utilidad de tokens se entiende mejor como un espectro: desde las cargas de trabajo de alto rendimiento y menor interacción servidas por SLM básicos o posentrenados, como la búsqueda y el chatbot, hasta cargas de trabajo en tiempo casi real que requieren los modelos más grandes con el contexto más largo, como la codificación basada en agentes y la automatización. La tarea estratégica es mapear cada caso de uso al punto correcto en ese espectro.
Un enfoque práctico es crear prototipos y validar con capacidad de vanguardia primero, luego definir objetivos estrictos de nivel de servicio (SLO) a través de la evaluación y, finalmente, optimizar y dimensionar correctamente para la escala. Las preguntas que ayudan a guiar ese proceso incluyen:
Obtener este mapeo de forma correcta tiene consecuencias directas en el proceso posterior. Determina qué modelos se implementan, cómo dimensionar las necesidades de infraestructura y, en última instancia, qué cobrar por los tokens producidos. La utilidad de tokens es la base sobre la que se basan las decisiones de demanda, oferta y monetización.
La infraestructura de IA de NVIDIA proporciona a los clientes la flexibilidad para elegir el valor de token óptimo al admitir una amplia gama de modelos de propiedad exclusiva y de peso abierto. NVIDIA también desarrolla Nemotron, una familia de modelos altamente eficientes, multimodales y abiertos diseñados para agentes de larga duración y autoevolutivos. Por ejemplo, Nemotron 3 Ultra completó análisis de referencia de codificación mediante menos tokens totales y menos tokens por turno que modelos comparables, lo que reduce el costo para las tareas basadas en agentes en hasta un 30 %.
¿Cómo pronostica la demanda de tokens? Comenzar con el caso de uso es la forma más efectiva de usar la demanda como una herramienta de pronóstico y planificación de infraestructura. El mercado está experimentando una expansión agresiva de casos de uso, desde chatbots para consumidores y empresas hasta la codificación y la automatización basada en agentes. Este cambio está transformando rápidamente el panorama de la demanda de un mercado de billones de tokens a cuatrillones, cambiando fundamentalmente la carga de trabajo y las características de la demanda de los tokens y su costo unitario.
Las empresas requieren metodologías para pronosticar su propia demanda para la planificación de capital y gastos operativos asociados con sus casos de uso de IA. El enfoque basado en los primeros principios consta de tres niveles:
Un modelo de pronóstico de demanda de tokens de tres capas, desde las estimaciones de base a través de multiplicadores de carga de trabajo hasta las variables de demanda operativas que dan forma a los requisitos de infraestructura del mundo real. El modelo de tres niveles con codificación de colores: El verde indica componentes compartidos con la planificación de la capacidad de software tradicional, y el naranja destaca las variables exclusivas de la entrega de tokens (tokens por solicitud, razonamiento, bucles de agentes).
Es en las estimaciones de la demanda basadas en el nivel 1 donde comienza la planificación de la capacidad. Sirven como una comprensión de base de los requisitos para implementaciones de prueba de concepto, pero rara vez escalan a la producción. Los multiplicadores de demanda de cargas de trabajo pueden escalar la demanda de tokens por un orden de magnitud. Como se muestra en el ejemplo a continuación, si la infraestructura se aprovisionara en función únicamente de la estimación de la demanda base, la aplicación asociada tendría más de 600 millones de tokens por día.
Las consideraciones de la demanda operativa (capa 3) requieren modelar la demanda a un nivel más granular. Esta hoja de trabajo de pronóstico por demanda de tokens proporciona una versión completa para guiarlo a través de los tres niveles.
El pronóstico de demanda de tokens se aparta menos de la planificación de la capacidad de software tradicional de lo que podría parecer. La mayoría de las entradas (sesiones, solicitudes, intentos repetidos, tasas de éxito en caché, patrones temporales y acuerdos de nivel de servicio o SLA de latencia) se comparten con prácticas que los equipos de infraestructura ya conocen. Tres variables son únicas para los tokens de servicio: tokens por solicitud, costo computacional de razonamiento y bucles de agentes. Lo que diferencia el perfil de demanda de una implementación del de otra no es la metodología, sino el contexto: el caso de uso, la organización que lo implementa y las decisiones de diseño de aplicaciones integradas en el workflow.
Las organizaciones que tratan estos tres niveles como un modelo vivo en lugar de un ejercicio de una sola vez estarán mejor posicionadas para dimensionar la infraestructura a medida que las cargas de trabajo basadas en agentes escalan y demandan compuestos de token.
El suministro de tokens se trata fundamentalmente de la eficiencia: maximizar la producción de tokens a la vez que se minimiza el costo de la producción de tokens.
Lograr esto requiere la optimización conjunta en toda la eficiencia de modelos, la eficiencia de sistemas y la eficiencia de software. Ningún componente es suficiente por sí solo. Los tres deben diseñarse junto con el ecosistema. NVIDIA llama a esto "diseño conjunto extremo" y abarca modelos y algoritmos, computación, redes, memoria, almacenamiento, software y el ecosistema de socios y clientes, con cada componente trabajando en conjunto para hacer que el todo sea mayor que la suma de sus partes y permitir que el sistema genere el costo de tokens más bajo.
Eficiencia de Modelos
Las arquitecturas de mezcla de expertos (MoE) ofrecen ganancias significativas en la eficiencia de modelos al activar solo los parámetros relevantes para cada token. Por ejemplo, Kimi K2.5 tiene 1 billón de parámetros, pero activa solo 32 mil millones por token, lo que ofrece la inteligencia de un modelo denso mucho más grande a una fracción del costo de computación. El costo oculto es la comunicación entre expertos repartidos en todas las GPU. La inferencia de MoE genera un tráfico pesado de todo a todo entre las GPU en todos los lotes, y las ganancias de eficiencia se evaporan si el sistema subyacente no puede manejar ese tráfico a escala.
Eficiencia del Sistema
NVIDIA GB200 NVL72 conecta 72 GPU a través del Switch NVIDIA NVLink™, lo que permite 1,800 gigabytes por segundo (GB/s) de ancho de banda de todo a todo. Este dominio de GPU más grande permite que los expertos se distribuyan en hasta 72 GPU sin los cuellos de botella de comunicación que limitan las configuraciones de malla fija y de un solo nodo o los enfoques de escalabilidad basados en Ethernet estándar. Esto garantiza que la eficiencia teórica de los modelos de MoE se haga realidad en la producción.
Eficiencia de Software
Aprovechar todo el potencial del hardware requiere una pila de software optimizada en tres capas arquitectónicas: acceso a la infraestructura, aceleración de aplicaciones y orquestación y servicio. NVIDIA ofrece una pila de software sólida que puede permitir cada optimización simultáneamente. Esto es más difícil de lo que parece, pero el efecto de composición es lo que produce mejoras de cambio de paso en el resultado de los tokens entregados. Las optimizaciones continuas de software por parte del ecosistema de código abierto y NVIDIA hacen que el hardware existente sea más productivo con el tiempo.
El resultado del diseño conjunto extremo es el costo por token más bajo en la industria en GB200 NVL72.
Optimización Dentro de las Restricciones Empresariales
La mayoría de las empresas necesitan optimizar el costo de los tokens dentro de las huellas de los data centers y las restricciones del entorno existentes. Por ejemplo, la densidad de energía en bastidor promedio es de alrededor de 27 kilovatios (kW) y el 75 % de los data centers aún están refrigerados por aire en lugar de por agua. Las empresas a menudo también tienen cargas de trabajo mixtas fuera de la IA, como el procesamiento de datos o gráficos, y una disponibilidad de capital inicial limitada para abordar estas restricciones. NVIDIA ofrece opciones adaptadas a los propósitos. NVIDIA HGX™ B200 y B300 ofrecen el costo de tokens más bajo para fábricas de IA con refrigeración por aire. NVIDIA RTX PRO 6000 Blackwell ofrece hasta 3 veces la eficiencia de tokens de los sistemas NVIDIA Hopper de la generación anterior para cargas de trabajo de inferencia empresarial.
Eficiencia de Generación de Tokens
Rendimiento por Megavatio y Costo por Token: Las Métricas que Importan
La mayoría de las organizaciones aún evalúa la infraestructura de IA mediante métricas de entrada como el costo por GPU-hora, las operaciones de punto flotante por segundo (FLOPS) o FLOPS por dólar. Estas son las métricas incorrectas para evaluar la infraestructura de IA. Cuatro mediciones que comparan NVIDIA Blackwell y Hopper dan sentido al caso:
Las métricas que más importan son el rendimiento por MW y el costo por token.
La producción por MW afecta sus ingresos y el costo por token determina la rentabilidad por interacción y la rapidez con la que una empresa puede crecer. Estas métricas capturan el desempeño de hardware, la optimización de software y la utilización del mundo real en una sola métrica. Para un tratamiento más profundo del costo de propiedad de la inferencia, consulte Repensar el TCO de la IA: Por Qué el Costo por Token es la Única Métrica que Importa.
A medida que la IA basada en agentes madura, las ideas adyacentes están emergiendo junto con el costo por token: inteligencia por token, tokens por tarea y costo por tarea. El costo por tarea es una función de la eficiencia con la que un modelo genera inteligencia (inteligencia por token) y la eficiencia con la que un modelo usa tokens para completar una tarea (tokens por tarea).
La utilidad define lo que vale un token. La demanda pronostica cuántos tokens se consumirán y quién lo hará. La oferta decide lo que cuesta producir.
La monetización reúne estos tres pilares y responde a la pregunta empresarial central: ¿Cómo se fija el precio y se venden tokens para que la economía sea favorable y sostenible?
No hay un solo modelo económico para cómo monetizar tokens. Han surgido cuatro estrategias clave, cada una adecuada para diferentes contextos empresariales y puntos de partida.
La mecánica de precios que sigue se basa en la venta de tokens directamente. Para los productos y servicios basados en tokens, el enfoque es conceptualmente similar, aunque las organizaciones también deben tener en cuenta el valor adicional que están ofreciendo al cliente final.
Obtener los fundamentos de precios correctos es fundamental, independientemente de qué modelo busque una organización.
Cómo Determinar el Precio de Tokens
Al fijar precios de tokens, considere tres factores importantes:
En última instancia, los ingresos por tokens dependen de la producción de tokens, el precio de los tokens y la distribución de la demanda en todos los niveles de precios. Los márgenes de ganancia dependen del costo para producir tokens. Por lo tanto, las decisiones de infraestructura son directamente relevantes para los ingresos. La plataforma NVIDIA Vera Rubin aumenta el rendimiento y reduce el costo por token en diez veces. Además, Vera Rubin con LPX permite cargas de trabajo de alta interactividad e inteligencia que ofrecen precios premium, lo que expande las oportunidades de ingresos y los márgenes en la parte superior del espectro de precios.
Los siguientes estudios de caso ilustran cómo las organizaciones están poniendo en práctica estas estrategias en cada uno de los cuatro modelos: la venta de tokens directamente, el desarrollo de ofertas nativas de IA, la mejora de los productos y servicios existentes y la transformación de las operaciones internas. Los números de desempeño y eficiencia presentados anteriormente en esta guía destacan lo que se puede lograr con el diseño conjunto completo. Los estudios de caso que siguen muestran a las organizaciones en varias etapas de ese proceso, donde los resultados reflejan su combinación específica de selección de modelos, longitudes de secuencia, precisión numérica, optimizaciones de inferencia y hardware implementado.
Resumen
Cohere, fundada en 2019, es una empresa líder de IA soberana que desarrolla modelos fundacionales y productos integrales para resolver problemas empresariales del mundo real. Cohere trabaja a ambos lados de la economía de tokens: desarrolla sus propios modelos y desarrolla los productos y soluciones que usan esos modelos. La principal familia de grandes modelos de lenguaje (LLM) de Cohere es la familia de modelos Command/North, que incluye Command A Vision (multimodal) y Command A Translate, más Embed y Rerank para la búsqueda.
Cohere también desarrolló North, un espacio de trabajo de IA empresarial seguro en el que los empleados trabajan junto a agentes de IA personalizables que buscan datos de la empresa con RAG, usan herramientas, ejecutan workflows e impulsan automatizaciones.
Objetivo
A medida que North se ejecuta en los propios modelos de Cohere, cada interacción necesita tokens y es sensible a la latencia, por lo que la eficiencia de la inferencia impulsa directamente los márgenes y la calidad de los productos de Cohere. Debido a esto, Cohere necesita la mejor infraestructura de IA para proporcionar el costo de tokens más bajo, reducir la latencia y lograr un alto rendimiento por nodo. Cohere ejecuta un programa de evaluación comparativa continuo en todos los modelos, hardware y niveles de carga.
Solución
Cohere movió sus modelos de producción de NVIDIA H100 a NVIDIA Blackwell B200 y GB200, que normalmente se ejecutan con precisión FP8.
Resultados
En los propios análisis de referencia internos de Cohere que comparan NVIDIA H100 con NVIDIA B200, el equipo encontró:
Gráfico de barras que muestra la ganancia de rendimiento máximo igualada de B200 en comparación con H100 (hasta 64 usuarios).
Las Ganancias Técnicas Generan Valor Empresarial
Un mayor rendimiento por nodo y una menor latencia se convierten en márgenes y un mejor producto.
En general, Cohere ha logrado mejores márgenes, mayor escala, mayor flexibilidad y una mejor experiencia del cliente al ofrecer sus modelos y soluciones en NVIDIA Blackwell.
Para ilustrar, la siguiente tabla muestra el impacto empresarial general que Cohere ha logrado con NVIDIA Blackwell.
Nota: El rendimiento medido se combina con los precios de GPU disponibles públicamente para ilustrar la forma del impacto, no los costos reales de Cohere.
Costo ilustrativo por 1 millón de tokens (misma cantidad de GPU; ilustrativo $3.50/H100-hr y $6.00/B200-hr = 1.71 veces el precio premium).
| Modelo (Escenario) | Costo de H100 por 1 Millón de Tokens | Costo de B200 por 1 Millón de Tokens | Ganancia de Rendimiento | Tokens por Dólar |
|---|---|---|---|---|
| Command A Translate (1K/100) | $0.39 | $0.26 | 2.62 veces | +53 % (-35 % costo) |
| Command A+ (10K/1K) | $0.128 | $0.113 | 1.93 veces | +13 % (-11 % costo) |
| Command A Vision (1 imagen) | $1.99 | $1.83 | 1.87 veces | +9 % (-8 % costo) |
Ganancia en tokens por dólar = ganancia en rendimiento/precio superior de GPU. Con un rendimiento por encima de aprox. 1.7 veces (contexto largo, alta concurrencia, traducción), NVIDIA Blackwell produce ahorros reales en costo por token. La ventaja crece a medida que la brecha de precios de B200/H100 se reduce (las tarifas de la nube son a menudo más cercanas a 1.5 veces).
Resumen
Perplexity es una plataforma de agentes de IA centrada en la IA precisa. La plataforma de la compañía aprovecha 15 modelos de IA, incluido NVIDIA Nemotron™ 3 Ultra, enrutando cada carga de trabajo a través del pipeline al modelo con la mejor relación costo-calidad para optimizar el desempeño, la calidad y el costo para nuestros clientes.
"Cada generación de hardware de NVIDIA nos ha comprado algo específico. NVIDIA Hopper nos permite servir a nuestra flota de modelos. NVIDIA Blackwell, con el dominio NVLink más grande y MXFP8 en los núcleos Tensor, nos permite servirlo en múltiples nodos sin pagarlo con la latencia. Eso es lo que hace que las cargas de trabajo a las que nos estamos moviendo sean económicamente viables". – Denis Yarats, Cofundador y CTO, Perplexity
Objetivo
El objetivo empresarial de Perplexity es ofrecer una IA precisa a escala del consumidor, a la vez que se preserva la economía necesaria para la confiabilidad y el crecimiento de nivel empresarial. La infraestructura de producción de Perplexity ya sirve a más de 50 millones de consultas al día en una flota de 15 modelos, a un tiempo de percentil 50 hasta el primer token (P50 TTFT), que va desde 2.4 segundos en búsqueda rápida hasta aproximadamente 13 segundos en trabajo de razonamiento profundo. A medida que más de ese tráfico cambia al trabajo basado en agentes de múltiples horas en Perplexity Computer, Perplexity hace que cada unidad de inteligencia sea más barata, rápida y confiable, para que el costo y la latencia escalen sublinealmente con el tráfico y la complejidad de las tareas.
Solución
La infraestructura de IA de Perplexity se basa en múltiples generaciones de hardware de NVIDIA, incluidas NVIDIA Hopper y NVIDIA Blackwell, y está orquestada y optimizada con la pila de software de data centers de NVIDIA.
Perplexity desarrolló su pila de inferencia en NVIDIA para reducir el costo por token sin renunciar a la precisión ni la latencia. Cada generación sucesiva de GPU mejora significativamente y, cuando se combina con FlashInfer, CuTe DSL, SHARP, la cuantificación MXFP8 y la prestación de precargado y decodificación desagregada, pueden extraer más tokens por hora de GPU.
Resultados
Perplexity logró una mejora de aproximadamente 2 a 4 veces en el costo de los tokens de salida en GB200 de múltiples nodos en comparación con H200 de un solo nodo, a la vez que también redujo la latencia de envío en un 46.5 % en los modelos MoE.
Latencia Reducida
La siguiente tabla compara la latencia de envío de MoE en H200 y GB200 mediante los transportes NVLink y NVLS, mostrando que GB200 con NVLS reduce la latencia de envío en un 46.5 % en comparación con H200 con NVLS (313.3 μs en comparación con 586.1 μs).
Perplexity
Rendimiento Mejorado
El próximo gráfico muestra el rendimiento de decodificación por GPU en comparación con la velocidad de decodificación para GB200 (EP = 4/8/16) y H200 (EP = 8/16), mostrando que las implementaciones de múltiples nodos de GB200 logran un rendimiento por GPU de 2 a 4 veces en comparación con H200 de un solo nodo a velocidades de decodificación emparejadas, gracias al dominio más grande de NVLink.
Perplexity
Resumen
La misión de Canva es permitir que el mundo diseñe. El conjunto de herramientas de diseño de IA de Canva puede ayudar a cualquiera a hacer su mejor trabajo, desde publicaciones en las redes sociales hasta presentaciones y videos cortos. Entre las funciones más populares de su suite de Diseño está el generador de IA de imagen a video, que transforma una foto fija en un clip animado corto, que no requiere software y funciona en cualquier dispositivo.
"Trabajar con NVIDIA ayuda a Canva a mejorar la eficiencia de las experiencias creativas impulsadas por IA como la imagen en el video, a la vez que preserva la velocidad y la calidad que nuestros usuarios esperan. Esa eficiencia es clave para hacer que las herramientas creativas avanzadas sean accesibles para más personas". – Stefano Corazza, Jefe de Investigación de IA, Canva
Objetivo
Canva actualmente tiene más de 265 millones de usuarios activos mensuales, lo que los convierte en una de las tres aplicaciones de IA más utilizadas en el mundo. Para que el popular generador de IA de imagen a video esté disponible para todos, Canva ha desarrollado una infraestructura de inferencia especializada impulsada por NVIDIA. Esto garantiza que los videos generados cumplan con los más altos estándares de la industria, a la vez que se mantiene el costo por generación y la latencia en niveles razonables.
Solución
Canva ejecuta su pila de inferencia de imagen a video en NVIDIA para reducir el costo por generación sin sacrificar la precisión o la latencia. La función está impulsada por un modelo de video de transformador de difusión, servido en NVIDIA B200s. Gracias a los pipelines de inferencia y posprocesamiento distribuidos y optimizados combinados con kernels especializados en hardware, Canva ofrece más video generado por GPU-hora, lo que permite que la experiencia gratuita de imagen a video escale a una base de usuarios global.
Resultados
Canva pudo lograr un 70 % más de generaciones de video por hora de GPU en B200s en comparación con H200s.
Cómo Usar esta Hoja de Trabajo: Complete cada [_blank_] con el número apropiado. Los resultados de cada capa alimentan la siguiente capa. El cálculo en cada sección muestra exactamente lo que se multiplica y cómo los números se producen en cascada.
Capa 1: Demanda de Base
Estamos dimensionando esta implementación para [__________] usuarios, cada uno ejecutando alrededor de [__________] tareas todos los días. Una solicitud típica envía [__________] tokens de entrada, y el modelo devuelve [__________] tokens de salida.
Entradas
A. Usuarios ............................. [__________]
B. Tareas por usuario por día ........ [__________]
C. Longitud de la secuencia de entrada (ISL) ...... [__________] tokens<
D. Longitud de secuencia de salida (OSL) ...... [__________] tokens
El Cálculo
Sesiones / Día = A × B
= [_____] × [_____]
= [_______________] sesiones/día
Tokens/Solicitud = C + D
= [_____] + [_____]
= [_______________] tokens/solicitud
Tokens Base / Día = Sesiones × Tokens/Solicitud
= [_____] × [_____]
= [_______________] tokens/día
Tokens Base / Mes = Diariamente × 30
= [_______________] tokens/mes
Capa 2: Multiplicadores de Cargas de Trabajo
Cada paso quema alrededor de [__________] tokens de razonamiento ocultos y una sola cadena de tareas a través de [_____] pasos de agente. Las fallas y los retrocesos agregan un costo de reintento de [_____] veces, y asociamos un prompt del sistema de tokens [__________] a cada llamada. La caché de prompts está alcanzando el [_____] % de los tokens de prompts del sistema.
Entradas
E. Tokens de razonamiento por paso ....... [__________]
F. Pasos de agente por tarea ............ [_____]
G. Volver a probar el multiplicador ................ [_____] ×
H. Tokens de indicaciones del sistema por paso ... [__________]
I. Tasa de éxito en caché .................. [_____] %
El Cálculo
Tokens Ajustados/Solicitud = Tokens/Sol. + E
= [_____] + [_____]
= [_______________]
Tokens/Tarea (con pasos) = Ajustado × F
= [_____] × [_____]
= [_______________]
Tokens/Tarea (con reintentos) = Arriba × G
= [_____] × [_____]
= [_______________]
Ahorro en Caché/Día = H × (I / 100) × F × Sesiones
= [_____] × [_____] × [_____] × [_____]
= [_______________] tokens ahorrados/día
Tokens Efectivos/Día = (Tokens/Tarea × Sesiones) − Ahorros en Caché
= [_____] − [_____]
= [_______________] tokens/día
Tokens Efectivos / Mes = Diariamente × 30
= [___________] tokens/mes
Capa 3: Conformación Operativa
Alrededor del [_____] % del tráfico diario aterriza dentro de una ventana comercial de [_____] horas. Dentro de ese pico, el tráfico real alcanza [_____] veces el promedio en ventana, y los picos estacionales nos estiran otro [_____]×. Para cumplir con los SLA de latencia, mantenga un espacio adicional de [_____] veces.
Entradas
J. Concentración en la hora pico ......... [_____] %
K. Horas de ventana pico ............... [_____] horas
L. Relación de ráfaga ..................... [_____] ×
M. Factor de picos estacionales ........... [_____] ×
N. Espacio adicional de SLA de latencia ............ [_____] veces
El Cálculo
TPM Promedio (24 horas) = Efectivo Diariamente ÷ 1,440
= [_____] ÷ 1,440
= [_______________] tokens/min.
TPM Avg (ventana pico) = (Efectivo Diariamente × J/100) ÷ (K × 60)
= ([_____] × [_____]) ÷ ([_____] × 60)
= [_______________] tokens/min.
TPM Ráfaga Pico = TPM Pico × L
= [_____] × [_____]
= [_______________] tokens/min.
TPM Pico + SLA = Ráfaga × N
= [_____] × [_____]
= [_______________] tokens/min.
TPM Pico + Estacional = Arriba × M
= [_____] × [_____]
= [_______________] tokens/min.
La tokenómica de NVIDIA se centra en optimizar el costo y los ingresos de la generación de tokens de IA por vatio, con el objetivo de reducir el costo general por token a través de arquitecturas como NVIDIA Blackwell y Vera Rubin. Para analizar los precios de la infraestructura o las licencias de software, puede comunicarse a través del formulario a continuación.