Documentación técnica
La IA se ejecuta en tókenes. La forma en que los utiliza, escala, genera y monetiza determina su ventaja competitiva en IA. Seleccione la longitud de modelo y contexto óptima para cada caso de uso, implemente una infraestructura que maximice los tókenes por vatio y minimice el coste por token, e impulse el crecimiento de los ingresos y los márgenes a escala.
Los centros de datos se están convirtiendo en fábricas de tókenes de IA. Donde antes se procesaban transacciones y servían páginas web, ahora se fabrica un nuevo tipo de producto: los tókenes, la unidad de inteligencia producida por los modelos de IA durante la inferencia. A medida que la IA pasa de la experimentación a la producción, la inferencia se ha convertido en la carga de trabajo dominante, mientras que los tókenes se han convertido en el nuevo producto básico que las empresas deben aprender a producir, gestionar y monetizar.
¿Qué es la tokenomía? Se refiere a la economía de la generación y el uso de tókenes, un término que utiliza frecuentemente el ecosistema, pero que puede carecer de precisión. Para definir en detalle lo que significa realmente la tokenomía, resulta útil describir cómo se valoran, consumen, suministran y monetizan los tókenes.
La tokenomía abarca cuatro pilares interconectados:
Cada pilar de la tokenómica no existe de forma aislada. Las decisiones sobre la oferta afectan directamente a los márgenes, las previsiones de la demanda determinan los requisitos de infraestructura y la utilidad de tókenes establece el límite máximo de lo que se puede cobrar. Estos cuatro pilares son profundamente interdependientes, y aplicarlos correctamente es lo que separa a las empresas de IA sostenibles de los costosos experimentos. Este documento explora cada uno de ellos en profundidad y proporciona un marco para que las empresas que planifican o escalan sus implementaciones de IA.
No todos los tókenes son iguales. El valor de un tóken depende de dos dimensiones:
Cuanto mayor sea la inteligencia y más rápida sea la interactividad, más costosa será la producción de esos tókenes. Pero el valor obtenido de estos tókenes depende del caso de uso y depende totalmente de si el caso de uso puede aprovecharlos. Un modelo de lenguaje de pequeño tamaño (SLM) posentrenado puede igualar o superar a un modelo mucho más grande e inteligente para tareas específicas del ámbito a una fracción del coste. Una canalización de procesamiento de documentos por lotes tiene requisitos de interactividad muy diferentes a los de un asistente de codificación en tiempo real. El valor adicional solo vale la pena pagar si la aplicación puede utilizarlo.
La utilidad de los tókenes se entiende mejor como un espectro: desde cargas de trabajo de ividad de alto rendimiento y baja interacción atendidas por SLM básicos o posentrenados, como búsquedas y chatbots, hasta cargas de trabajo casi en tiempo real que requieren los modelos más grandes con el contexto más largo, como codificación agéntica y automatización. La tarea estratégica es mapear cada caso de uso al punto adecuado en ese espectro.
Un enfoque práctico consiste en crear prototipos y validar con capacidad de vanguardia, luego definir estrictos objetivos de nivel de servicio (SLO) a través de la evaluación y, por último, optimizar y ajustar el tamaño adecuado para la escala. Las preguntas que ayudan a guiar ese proceso incluyen:
Lograr correctamente este mapeo tiene consecuencias directas en el futuro. Determina qué modelos se implementan, cómo dimensionar las necesidades de infraestructura y, en última instancia, cuánto se cobrará por los tókenes producidos. La utilidad de los tókenes es la base sobre la que se toman las decisiones sobre demanda, oferta y monetización.
La infraestructura de IA de NVIDIA proporciona a los clientes la flexibilidad necesaria para elegir un valor tokenístico óptimo al admitir una amplia gama de modelos patentados y de peso abierto. NVIDIA también crea Nemotron, una familia de modelos abiertos, multimodales y altamente eficientes diseñados para agentes de ejecución prolongada y con evolución automática. Por ejemplo, Nemotron 3 Ultra completó las pruebas de referencia de codificación utilizando menos tókenes totales y menos tókenes por turno que los modelos comparables, lo que redujo el coste de las tareas de agentes hasta un 30 %.
¿Cómo pronostica la demanda de tókenes? Empezar por el caso de uso es la forma más eficaz de utilizar la demanda como herramienta de previsión y planificación de la infraestructura. El mercado está experimentando una expansión agresiva de los casos de uso, desde chatbots de consumidores y empresas hasta la codificación y la automatización basada en agentes. Este cambio está transformando rápidamente el panorama de la demanda, pasando de un mercado de billones de tókenes a cuatrillones, lo que cambia fundamentalmente la carga de trabajo y las características de la demanda de los tókenes, así como su coste unitario.
Las empresas necesitan metodologías para predecir su propia demanda para planificar los gastos de capital y operativos asociados a sus casos de uso de IA. El enfoque basado en los primeros principios consta de tres niveles:
Un modelo de previsión de la demanda de tókenes de tres capas, desde estimaciones básicas hasta multiplicadores de cargas de trabajo y variables de demanda operativa que determinan los requisitos de infraestructura del mundo real. El modelo de tres niveles con codificación de colores: el verde indica componentes compartidos con la planificación de la capacidad de software tradicional, mientras que el naranja destaca las variables únicas para la entrega de tókenes (tókenes por solicitud, razonamiento, bucles de agentes).
Las estimaciones de la demanda basadas en el nivel 1 son el punto de partida para la planificación de la capacidad. Sirven para comprender los requisitos de referencia para las implementaciones de pruebas de concepto, pero rara vez se escalan a la producción. Los multiplicadores de demanda de cargas de trabajo pueden escalar la demanda de tókenes por orden de magnitud. Como se muestra en el siguiente ejemplo, si se aprovisionara la infraestructura basándose únicamente en la estimación de la demanda base, la aplicación asociada sería de menos de 600 millones de tókenes por día.
Las consideraciones de demanda operativa (capa 3) requieren una demanda de modelado a un nivel más granular. Esta hoja de trabajo de previsión de la demanda de tókenes proporciona una versión de relleno en blanco para guiarle a través de los tres niveles.
La previsión de la demanda de tókenes se diferencia menos de la planificación de la capacidad de software tradicional de lo que podría parecer. La mayoría de los datos (sesiones, solicitudes, repruebas, tasas de éxito en la caché, patrones temporales y acuerdos de nivel de servicio (SLA) de latencia) se comparten con prácticas que los equipos de infraestructura ya conocen. Tres variables son exclusivas para servir tókenes: tókenes por solicitud, sobrecarga de razonamiento y bucles de agentes. Lo que diferencia el perfil de demanda de una implementación del de otra no es la metodología, sino el contexto: el caso de uso, la organización que la implementa y las decisiones de diseño de aplicaciones integradas en el flujo de trabajo.
Las organizaciones que tratan estos tres niveles como un modelo real en lugar de un ejercicio aislado estarán en la mejor posición para adaptar la infraestructura a medida que las cargas de trabajo de agentes se escalan y la demanda de tókenes.
El suministro de tókenes se basa fundamentalmente en la eficiencia: maximizar la producción de tókenes, al tiempo que se minimiza el coste de producción de tókenes.
Para lograr este objetivo, es necesario optimizar conjuntamente la eficiencia de los modelos, la eficiencia del sistema y la eficiencia del software. Ningún componente es suficiente por sí solo. Las tres deben diseñarse conjuntamente con el ecosistema. NVIDIA denomina a esto «diseño conjunto extremo» y abarca modelos y algoritmos, computación, redes, memoria, almacenamiento, software y el ecosistema de partners y clientes. Cada componente funciona conjuntamente para lograr que el conjunto sea superior a la suma de sus partes, lo que permite al sistema generar el menor coste por token.
Eficiencia de modelos
Las arquitecturas de mezcla de expertos (MoE) ofrecen mejoras significativas en la eficiencia de los modelos al activar solo los parámetros relevantes para cada token. Por ejemplo, Kimi K2.5 tiene 1 billón de parámetros, pero solo activa 32 000 millones por token, lo que proporciona la inteligencia de un modelo denso mucho más grande a una fracción del coste de computación. El coste oculto es la comunicación entre expertos repartidos por todas las GPU. La inferencia de MoE genera un pesado tráfico de todo a todo entre las GPU en todos los lotes, y las mejoras en eficiencia se evaporan si el sistema subyacente no puede gestionar ese tráfico a escala.
Eficiencia del sistema
El NVIDIA GB200 NVL72 conecta 72 GPU a través del NVIDIA NVLink™ Switch, lo que permite 1800 gigabytes por segundo (GB/s) de ancho de banda de todo a todo. Este dominio de GPU más amplio permite distribuir expertos en hasta 72 GPU sin los cuellos de botella de comunicación que limitan las configuraciones de malla fija, de un solo nodo o los enfoques de escalado vertical basados en Ethernet estándar. Esto garantiza que la eficiencia teórica de los modelos MoE se haga realidad en la producción.
Eficiencia de software
Para aprovechar todo el potencial del hardware, se requiere una pila de software optimizada en tres capas arquitectónicas: acceso a la infraestructura, aceleración de aplicaciones y orquestación y servicio. NVIDIA proporciona una pila de software robusta que puede permitir todas las optimizaciones simultáneamente. Esto es más difícil de lo que parece, pero el efecto de combinación es lo que produce mejoras drásticas en la producción de tókenes entregada. Las optimizaciones continuas de software realizadas por el ecosistema de código abierto y NVIDIA hacen que el hardware existente sea más productivo con el tiempo.
El resultado de un diseño conjunto extremo es el coste por token más bajo del sector en la GB200 NVL72.
Optimización dentro de las restricciones empresariales
La mayoría de las empresas deben optimizar los costes por token dentro de la huella de los centros de datos existentes y las restricciones del entorno. Por ejemplo, la densidad de potencia media del bastidor es de unos 27 kilovatios (kW) y el 75 % de los centros de datos siguen estando refrigerados por aire en lugar de por agua. Las empresas también suelen tener cargas de trabajo mixtas fuera de la IA, como el procesamiento de datos o gráficos y una disponibilidad limitada de capital inicial para abordar estas restricciones. NVIDIA ofrece opciones adaptadas a sus necesidades. Las unidades NVIDIA HGX™ B200 y B300 ofrecen el coste por token más bajo para las fábricas de IA con refrigeración por aire. La NVIDIA RTX PRO™ 6000 Blackwell ofrece una eficiencia de tókenes hasta 3 veces superior a la de los sistemas NVIDIA Hopper™ de la generación anterior para cargas de trabajo de inferencia empresarial.
Eficiencia de generación de tókenes
Rendimiento por megavatio y coste por token: las métricas que importan
La mayoría de las organizaciones todavía evalúan la infraestructura de IA utilizando métricas de entrada, como el coste por hora de GPU, las operaciones de coma flotante pico por segundo (FLOPS) o los FLOPS por dólar. Estas son las métricas incorrectas para evaluar la infraestructura de IA. Cuatro parámetros que comparan NVIDIA Blackwell y Hopper ilustran el caso:
Las métricas que más importan son el rendimiento por MW y el coste por token.
El rendimiento por MW afecta a sus ingresos, mientras que el coste por token determina la rentabilidad por interacción y la rapidez con que puede crecer una empresa. Estas métricas capturan el rendimiento del hardware, la optimización del software y la utilización en el mundo real en una sola métrica. Si desea obtener información más detallada sobre el coste total de propiedad de inferencia, consulte Replantearse el coste total de propiedad de la IA: ¿Por qué el coste por token es la única métrica que importa?
A medida que la IA agéntica madura, surgen ideas adyacentes junto con el coste por token: inteligencia por token, tókenes por tarea y coste por tarea. El coste por tarea depende de la eficiencia con que un modelo genera inteligencia (inteligencia por token) y de la eficiencia con que un modelo utiliza los tókenes para completar una tarea (tókenes por tarea).
La utilidad define el valor de un token. La demanda pronostica cuántos tókenes se consumirán y por quién. La oferta decide el coste de la producción.
La monetización reúne estos tres pilares y responde a la pregunta empresarial central: ¿Cómo se fija el precio y se venden tókenes para que la economía sea favorable y sostenible?
No existe un modelo económico único que determine la forma de monetizar los tókenes. Se han definido cuatro estrategias clave, cada una de ellas adaptada a diferentes contextos empresariales y puntos de partida.
La mecánica de precios que se establece a continuación se basa en la venta directa de tókenes. En el caso de los productos y servicios basados en tókenes, el enfoque es similar desde el punto de vista conceptual, aunque las organizaciones también deben tener en cuenta el valor adicional que ofrecen al cliente final.
Es fundamental establecer los principios básicos de fijación de precios adecuados, independientemente del modelo que elija una organización.
Cómo determinar el precio de los tókenes
Al fijar el precio de los tókenes, tenga en cuenta tres factores importantes:
En última instancia, los ingresos por tókenes dependen de la producción de tókenes, su precio y la distribución de la demanda en todos los niveles de precios. Los márgenes de beneficio dependen del coste de producir tókenes. Por lo tanto, las decisiones de infraestructura son directamente relevantes para los ingresos. La plataforma NVIDIA Vera Rubin aumenta el rendimiento y reduce el coste por token en 10 veces. Además, Vera Rubin con LPX desbloquea cargas de trabajo de alta interactividad y alta inteligencia que ofrecen precios premium, lo que amplía las oportunidades de ingresos y los márgenes en la parte superior de la gama de precios.
Los siguientes casos de estudio ilustran cómo las organizaciones ponen en práctica estas estrategias en cada uno de los cuatro modelos: venta directa de tókenes, creación de ofertas nativas de IA, mejora de los productos y servicios existentes y transformación de las operaciones internas. Las cifras de rendimiento y eficiencia presentadas anteriormente en esta guía destacan lo que se puede lograr con un diseño conjunto total. Los casos de estudio que se presentan muestran a las organizaciones en las diversas etapas de ese proceso, cuyos resultados reflejan su combinación específica de selección de modelos, longitudes de secuencias, precisión numérica, optimizaciones de inferencia y hardware implementado.
Resumen
Cohere, fundada en 2019, es una empresa de IA soberana líder en el desarrollo de modelos básicos y productos de extremo a extremo para resolver problemas empresariales del mundo real. Cohere trabaja en ambos lados de la economía de tókenes: crea sus propios modelos y los productos y soluciones que utilizan esos modelos. La principal familia de modelos de lenguaje de gran tamaño (LLM) de Cohere es la familia de modelos Command/North, que incluye Command A Vision (multimodal) y Command A Translate, además de Embed y Rerank para búsquedas.
Cohere también desarrolló North, un espacio de trabajo de IA empresarial seguro en el que los empleados trabajan junto con agentes de IA personalizables que analizan datos de la empresa con RAG, utilizan herramientas, ejecutan flujos de trabajo e impulsan las automatizaciones.
Objetivo
A medida que North se ejecuta utilizando los propios modelos de Cohere, cada interacción es ávida de tókenes y sensible a la latencia, por lo que la eficiencia de la inferencia impulsa directamente los márgenes de Cohere y la calidad de los productos. Por este motivo, Cohere necesita la mejor infraestructura de IA para proporcionar el menor coste por token, reducir la latencia y lograr un alto rendimiento por nodo. Cohere ejecuta un programa continuo de pruebas de referencia en todos los modelos, hardware y niveles de carga.
Solución
Cohere cambió sus modelos de producción de NVIDIA H100 a NVIDIA Blackwell B200 y GB200, que normalmente se ejecutan con precisión FP8.
Resultados
En las pruebas de referencia internas de Cohere, en las que se comparó NVIDIA H100 con NVIDIA B200, el equipo determinó:
Gráfico de barras que muestra la ganancia de rendimiento pico de B200 en comparación con H100 (hasta 64 usuarios).
Las mejoras técnicas generan valor empresarial
Un mayor rendimiento por nodo y una menor latencia se traducen en márgenes y un mejor producto.
En general, Cohere ha logrado mejores márgenes, una mayor escala, una mayor flexibilidad y una mejor experiencia para el cliente al ofrecer sus modelos y soluciones en NVIDIA Blackwell.
Para ilustrar esto, la siguiente tabla muestra el impacto empresarial general que ha logrado Cohere con NVIDIA Blackwell.
Nota: El rendimiento medido se combina con los precios de las GPU disponibles públicamente para ilustrar la forma del impacto, no los costes reales de Cohere.
Coste ilustrativo por 1 millón de tókenes (misma cantidad de GPU; indicativo de 3,50 USD/H100-hora y 6,00 USD/B200-hora = prima de precio 1,71 veces superior).
| Modelo (escenario) | Coste de H100 por cada millón de tókenes | Coste de B200 por 1 millón de tókenes | Aumento del rendimiento | Tókenes por dólar |
|---|---|---|---|---|
| Command A Translate (1K/100) | 0,39 $ | 0,26 $ | 2,62x | +53% (-35% cost) |
| Command A+ (10K/1K) | 128$ | 113$ | 1,93x | +13% (-11% cost) |
| Command A Vision (1 imagen) | 1,99 $ | 1,83 $ | 1,87x | +9% (-8% cost) |
Ganancia de tókenes por dólar = ganancia de rendimiento / precio de la GPU. Un rendimiento de ~1,7 veces superior (contexto largo, alta concurrencia, traducción) a NVIDIA Blackwell permite ahorros reales en el coste por token. La ventaja aumenta a medida que se reduce la diferencia de precios entre el B200 y el H100 (las tarifas de nube suelen estar más cerca de 1,5 veces).
Resumen
Perplexity es una plataforma de agentes de IA centrada en la IA precisa. La plataforma de la empresa aprovecha 15 modelos de IA, incluido NVIDIA Nemotron™ 3 Ultra, para enrutar cada carga de trabajo a través de la canalización al modelo con la mejor relación coste-calidad para optimizar el rendimiento, la calidad y los costes para nuestros clientes.
«Todas las generaciones de hardware de NVIDIA nos han aportado algo específico. NVIDIA Hopper nos permite servir nuestra flota de modelos. NVIDIA Blackwell, con el dominio NVLink más grande y MXFP8 en los núcleos Tensor, nos permite servirla en varios nodos sin pagar por la latencia. Eso es lo que hace que las cargas de trabajo en las que nos estamos ocupando sean económicamente viables». – Denis Yarats, cofundador y CTO de Perplexity
Objetivo
El objetivo empresarial de Perplexity es ofrecer IA precisa a escala de consumo, al tiempo que preserva la rentabilidad necesaria para la fiabilidad y el crecimiento de nivel empresarial. La infraestructura de producción de Perplexity ya procesa más de 50 millones de consultas diarias en una flota de 15 modelos, con un tiempo hasta el primer token en el percentil 50 (P50 TTFT), que va desde 2,4 segundos en búsqueda rápida hasta ~13 segundos en trabajo de razonamiento profundo. A medida que una mayor parte de ese tráfico se transforma en trabajo de agentes de varias horas en Perplexity Computer, Perplexity hace que cada unidad de inteligencia sea más económica, rápida y fiable, por lo que los costes y la latencia aumentan rápidamente con la complejidad del tráfico y las tareas.
Solución
La infraestructura de IA de Perplexity se basa en varias generaciones de hardware de NVIDIA, incluidas NVIDIA Hopper y NVIDIA Blackwell, y está orquestada y optimizada con la pila de software de centros de datos de NVIDIA.
Perplexity desarrolló su pila de inferencia a partir de NVIDIA para reducir el coste por token sin renunciar a la precisión ni a la latencia. El rendimiento de cada generación de GPU sucesiva mejora significativamente y, cuando se combina con FlashInfer, CuTe DSL, SHARP, cuantificación MXFP8 y servicio de prefill y descodificación desagregados, se puede extraer más tókenes por hora de GPU.
Resultados
Perplexity logró una mejora de aproximadamente 2-4 veces en el coste por tókenes de salida en la GB200 de varios nodos en comparación con la H200 de un solo nodo, al tiempo que redujo la latencia de envío en un 46,5 % en los modelos MoE.
Latencia reducida
El siguiente gráfico compara la latencia de despacho del MoE en H200 y GB200 utilizando los transportes NVLink y NVLS, y muestra que GB200 con NVLS reduce la latencia de despacho en un 46,5 % en comparación con H200 con NVLS (313,3 μs frente a 586,1 μs).
Perplexity
Rendimiento mejorado
El siguiente gráfico muestra el rendimiento de descodificación por GPU en comparación con la velocidad de descodificación para GB200 (EP = 4/8/16) y H200 (EP = 8/16), lo que muestra que las implementaciones de varios nodos GB200 logran un rendimiento por GPU entre 2 y 4 veces mejor que el de la H200 de un solo nodo a velocidades de descodificación equivalentes, gracias al dominio NVLink más grande.
Perplexity
Resumen
La misión de Canva es capacitar al mundo para diseñar. El conjunto de herramientas de diseño de IA de Canva puede ayudar a cualquier persona a hacer su mejor trabajo, desde publicaciones en redes sociales hasta presentaciones y vídeos cortos. Una de las características más populares de su conjunto de herramientas de diseño es el generador de IA de imagen a vídeo, que transforma una foto fija en un breve clip de animación, que no requiere software y funciona en cualquier dispositivo.
«La colaboración con NVIDIA ayuda a Canva a mejorar la eficiencia de las experiencias creativas con tecnología de IA, desde imágenes hasta vídeo, al tiempo que preserva la velocidad y la calidad que esperan nuestros usuarios. Esa eficiencia es clave para hacer que las herramientas creativas avanzadas sean accesibles para más personas». – Stefano Corazza, jefe de Investigación en IA, Canva
Objetivo
Canva tiene en la actualidad más de 265 millones de usuarios activos mensuales, lo que la convierte en una de las tres aplicaciones de IA más utilizadas del mundo. Para poner el popular generador de IA de imagen a vídeo al alcance de todos, Canva ha creado una infraestructura de inferencia especializada con tecnología de NVIDIA. Esto garantiza que los vídeos generados cumplan los más altos estándares del sector, al tiempo que mantienen el coste por generación y la latencia en niveles razonables.
Solución
Canva ejecuta su pila de inferencia de imagen a vídeo en NVIDIA para reducir el coste por generación sin sacrificar la precisión ni la latencia. La característica cuenta con tecnología de modelo de vídeo de transformador de difusión, servido en las NVIDIA B200. Gracias a las canalizaciones de inferencia distribuida y posprocesamiento optimizadas, combinadas con kernels especializados en hardware, Canva genera más vídeo por hora de GPU, lo que permite ampliar la experiencia de conversión de imagen a vídeo gratuita a una base de usuarios global.
Resultados
Canva logró un 70 % más de generaciones de vídeo por hora de GPU en las B200 en comparación con las H200.
Cómo utilizar esta hoja de trabajo: rellene cada [_blank_] con el número apropiado. Los resultados de cada capa se incorporan a la capa siguiente. Las matemáticas de cada sección muestran exactamente qué se multiplicó y cómo los números se encadenan en cascada.
Capa 1: demanda base
Estamos diseñando esta implementación para [__________] usuarios, cada uno de los cuales ejecuta unas [________] tareas diarias. Una solicitud típica envía [__________] tókenes de entrada, y el modelo devuelve [________] tókenes de salida.
Entradas
A. Usuarios ............................. [__________]
B. Tareas por usuario por día ........ [__________]
C. Longitud de la secuencia de entrada (ISL)...... [________] tókenes
D. Longitud de la secuencia de salida (OSL) ...... [__________] tókenes
Los cálculos
Sesiones/día = = A × B
= [_____] × [_____]
= [_______________] sesiones/día
Tókenes/solicitud = C + D
= [_____] + [_____] = [_______________] tókenes/solicitud
Tókenes base/día = sesiones × tókenes/solicitud
= [_____] × [_____]
= [_______________] tókenes/día
Tókenes base/mes = tókenes diarios × 30
= [_______________] tókenes/mes
Capa 2: multiplicadores de cargas de trabajo
Cada paso consume unos [__________] tókenes de razonamiento oculto, y una sola tarea se encadena a través de [_____] pasos de agentes. Los fallos y las fallas añaden una sobrecarga de [_____] reintentos más, y añadimos un [__________] indicador de sistema a cada llamada. El almacenamiento en caché prompt está alcanzando el [_____] % de los tókenes de aviso del sistema.
Entradas
E. Tókenes de razonamiento por paso ....... [__________]
F. Pasos de agentes por tarea ............ [_____]
G. Multiplicador de reintentos ................ [_____] ×
H. Tókenes de indicación del sistema por paso ... [__________]
I. Tasa de éxitos en la caché .............. [_____] %
Los cálculos
Tókenes ajustados/solicitud = tókenes/solcitud + E
= [_____] + [_____]
= [_______________]
Tókenes/tarea (con pasos) = tókenes ajustados × F
= [_____] × [_____]
= [_______________]
Tókenes/tarea (con reintentos) = valor anterior × G
= [_____] × [_____]
= [_______________]
Ahorro de caché/día = H × (I/100) × F × sesiones
= [_____] × [_____] × [_____] × [_____]
= [_______________] tókenes ahorrados/día
Tókenes efectivos/día = (tókenes/tareas × sesiones) − ahorro de caché
= [_____] − [_____]
= [_______________] tókenes/día
Tókenes efectivos/mes = tókenes diarios × 30
= [_______________] tókenes/mes
Capa 3: configuración operativa
Alrededor del [_____] % del tráfico diario se concentra dentro de una ventana de actividad empresarial de [_____] horas. Dentro de ese pico, el tráfico real aumenta [_____] veces la media de la ventana y los picos de temporada nos llevan a alcanzar otro [_____] adicional. Para cumplir los acuerdos de nivel de servicio (SLA) de latencia, mantenga [_____] más de margen de trabajo adicional.
Entradas
J. Concentración en horas punta ......... [_____] %
K. Horas de la ventana punta ............ [_____] horas
L. Factor de ráfaga ..................... [_____] veces
M. Factor de pico estacional ........... [_____] veces
N. Margen de maniobra de nivel de servicio de latencia ........ [_____] veces
Los cálculos
TPM medio (24 horas) = efectivo diario ÷ 1440
= [_____] ÷ 1440
= [_______________] tókenes/min
TPM promedio (ventana máxima) = (Valor diario efectivo × J/100) ÷ (K × 60)
= ([_____] × [_____]) ÷ ([_____] × 60)
= [_______________] tókenes/min
TPM de ráfaga pico = TPM pico × L
= [_____] × [_____]
= [_______________] tókenes/min
TPM máximo + SLA = ráfaga × N
= [_____] × [_____] = [_______________] tókenes/min
TPM máximo + estacional = arriba × M
= [_____] × [_____]
= [_______________] tókenes/min
La tokenómica de NVIDIA se centra en la optimización del coste y los ingresos de la generación de tókenes de IA por vatio, con el objetivo de reducir el coste general por token mediante arquitecturas como NVIDIA Blackwell y Vera Rubin. Para hablar sobre precios de infraestructura o licencias de software, póngase en contacto con nosotros a través del siguiente formulario.