White paper
L'IA viene eseguita su token. Il modo in cui le utilizzi, scali, le generi e le monetizzate determina il vantaggio competitivo dell'IA. Seleziona il modello e la lunghezza del contesto ottimali per ogni caso d'uso, distribuisci un'infrastruttura che massimizza i token per watt e riduce al minimo il costo per token e guida la crescita di ricavi e margini su vasta scala.
I data center stanno diventando fabbriche di token IA. Laddove prima elaboravano le transazioni e servivano pagine web, ora producono un nuovo tipo di output: i token, l'unità di intelligenza prodotta dai modelli IA durante l'inferenza. Con il passaggio dell'IA dalla sperimentazione alla produzione, l'inferenza è diventata il carico di lavoro dominante e i token sono diventati la nuova merce che le aziende devono imparare per produrre, gestire e monetizzare.
Cos'è la tokenomics? È l'economia della generazione e dell'utilizzo di token, un termine frequentemente utilizzato dall'ecosistema, ma a volte può mancare di precisione. Per comprendere meglio cosa significa veramente la tokenomics, è utile definirla come il modo in cui i token vengono valutati, consumati, forniti e monetizzati.
La tokenomics comprende quattro pilastri interconnessi:
Ogni pilastro della tokenomics non esiste in isolamento. Le decisioni sull'offerta influenzano direttamente i margini, le previsioni della domanda determinano i requisiti dell'infrastruttura e l'utilità token imposta il tetto a quanto può essere addebitato. Questi quattro pilastri sono profondamente interdipendenti e averli nel modo giusto è ciò che separa le aziende IA sostenibili da costosi esperimenti. Questo documento esplora ciascuno di essi in profondità, fornendo un framework per le aziende che pianificano o scalano le distribuzioni IA.
Non tutti i token sono creati uguali. Il valore di un token dipende da due dimensioni:
Più alta è l'intelligenza e più veloce è l'interattività, più costosi sono questi token. Tuttavia, il valore acquisito da questi token è relativo al caso d'uso e dipende interamente dalla capacità del caso d'uso di sfruttarli. Un modello linguistico di piccole dimensioni (SLM) post-addestrato può eguagliare o superare un modello molto più grande e intelligente per attività specifiche per dominio a una frazione del costo. Una pipeline di elaborazione dei documenti in batch ha requisiti di interattività molto diversi da un assistente di codifica in tempo reale. Il valore aggiuntivo vale la pena pagare solo se l'applicazione può utilizzarlo.
L'utilità dei token è meglio compresa come uno spettro: dai carichi di lavoro ivity ad alto throughput e a bassa interazione serviti da SLM di base o post-addestrati, come ricerca e chatbot, ai carichi di lavoro quasi in tempo reale che richiedono i modelli più grandi con il contesto più lungo, come la codifica e l'automazione agentica. L'attività strategica consiste nel mappare ogni caso d'uso al punto giusto su quello spettro.
Un approccio pratico consiste prima nel prototipare e convalidare con capacità di frontiera, quindi definire rigorosi obiettivi a livello di servizio (SLO) attraverso la valutazione e infine ottimizzare e dimensionare correttamente per la scalabilità. Le domande che aiutano a guidare questo processo includono:
Ottenere questa mappatura ha conseguenze dirette a valle. Determina quali modelli distribuire, come dimensionare le esigenze dell'infrastruttura e, in definitiva, quanto addebitare per i token prodotti. L'utilità dei token è la base su cui vengono costruite le decisioni di domanda, offerta e monetizzazione.
L'infrastruttura NVIDIA AI offre ai clienti la flessibilità per scegliere il valore ottimale dei token supportando una vasta gamma di modelli proprietari e aperti. NVIDIA crea inoltre Nemotron, una famiglia di modelli aperti altamente efficienti, multimodali e altamente efficienti progettati per gli agenti a lunga esecuzione e auto-evolutivi. Ad esempio, i benchmark di codifica Nemotron 3 Ultra hanno completato i benchmark utilizzando meno token totali e meno token al turn rispetto ai modelli paragonabili, riducendo i costi delle attività agentiche fino al 30%.
Come prevedete la domanda di token? Iniziare con il caso d'uso è il modo più efficace per utilizzare la domanda come strumento di previsione e pianificazione dell'infrastruttura. Il mercato sta vivendo un'espansione aggressiva dei casi d'uso, dai chatbot consumer e aziendali alla codifica e all'automazione agentica. Questo passaggio sta trasformando rapidamente il panorama della domanda da un mercato di trilioni di token a quadrilioni, cambiando radicalmente il carico di lavoro e le caratteristiche della domanda dei token e il loro costo unitario.
Le aziende hanno bisogno di metodologie per prevedere la propria domanda per la pianificazione delle spese di capitale e operative associate ai propri casi d'uso IA. L'approccio basato sui primi principi è composto da tre livelli:
Un modello di previsione della domanda per token su tre livelli, dalle stime di base ai moltiplicatori di carico di lavoro alle variabili di domanda operative che plasmano i requisiti dell'infrastruttura del mondo reale. Il modello a tre livelli con codifica a colori: il verde indica i componenti condivisi con la pianificazione della capacità del software tradizionale, mentre l'arancione evidenzia le variabili uniche per il token serving (token per richiesta, ragionamento, loop di agenti).
Le stime della domanda basate sul livello 1 sono il punto di partenza della pianificazione della capacità. Servono come base per la comprensione dei requisiti per le distribuzioni proof-of-concept, ma raramente vengono scalati in produzione. I moltiplicatori in base alla domanda del carico di lavoro possono scalare la domanda di token di un ordine di grandezza. Come mostrato nell'esempio seguente, se il provisioning dell'infrastruttura fosse stato effettuato esclusivamente in base alla stima della domanda di base, l'applicazione associata avrebbe a disposizione oltre 600 milioni di token al giorno.
Le considerazioni sulla domanda operativa (livello 3) richiedono una modellazione della domanda a livello più granulare. Questo foglio di lavoro di previsione della domanda per token fornisce una versione fill-in-the-blank per guidarti attraverso tutti e tre i livelli.
La previsione della domanda per token è meno diversa dalla pianificazione della capacità del software tradizionale di quanto possa sembrare. La maggior parte degli input (sessioni, richieste, ritentativi, percentuali di successo della cache, pattern temporali e service-level agreements (SLA) per la latenza) sono condivisi con practice che i team dell'infrastruttura già conoscono. Tre variabili sono uniche per i token di servizio: token per richiesta, overhead di ragionamento e loop per agenti. Ciò che differenzia il profilo di domanda di una distribuzione da quello di un'altra non è la metodologia, ma il contesto: il caso d'uso, l'organizzazione che lo distribuisce e le decisioni di progettazione dell'applicazione integrate nel flusso di lavoro.
Le organizzazioni che trattano questi tre livelli come un modello vivo anziché come un esercizio una tantum saranno nella posizione migliore per dimensionare correttamente l'infrastruttura man mano che i carichi di lavoro agentici scalano e fanno domanda composita di token.
La fornitura di token è fondamentalmente un'efficienza: massimizzare l'output di token riducendo al minimo il costo di produzione di token.
Per raggiungere questo obiettivo è necessaria la co-ottimizzazione dell'efficienza dei modelli, dell'efficienza del sistema e dell'efficienza del software. Nessun singolo componente è sufficiente da solo. Tutti e tre devono essere progettati insieme all'ecosistema. NVIDIA definisce questo fenomeno "co-progettazione estrema" e copre modelli e algoritmi, calcolo, rete, memoria, storage, software e l'ecosistema di partner e clienti, con ogni componente che lavora insieme per rendere l'insieme superiore alla somma delle sue parti e consente al sistema di generare il costo per token più basso.
Efficienza dei modelli
Le architetture mixture-of-experts (MoE) offrono guadagni significativi nell'efficienza dei modelli attivando solo i parametri pertinenti per ogni token. Ad esempio, Kimi K2.5 ha 1 trilione di parametri, ma ne attiva solo 32 miliardi per token, offrendo l'intelligenza di un modello denso molto più grande a una frazione del costo di calcolo. Il costo nascosto è la comunicazione tra esperti distribuiti su GPU. L'inferenza MoE genera un pesante traffico all-to-all tra le GPU nei vari batch e i guadagni in efficienza evaporano se il sistema sottostante non è in grado di gestire questo traffico su vasta scala.
Efficienza del sistema
NVIDIA GB200 NVL72 collega 72 GPU attraverso lo switch NVIDIA NVLink, consentendo 1.800 gigabyte al secondo (GB/s) di larghezza di banda all-to-all. Questo dominio GPU più ampio consente agli esperti di essere distribuiti su fino a 72 GPU senza i colli di bottiglia di comunicazione che limitano le configurazioni a mesh fissa e a nodo singolo o gli approcci scale-up basati su Ethernet pronti all'uso. Ciò garantisce che l'efficienza teorica dei modelli MoE sia realizzata in produzione.
Efficienza del software
Per realizzare il pieno potenziale dell'hardware è necessario uno stack software ottimizzato su tre livelli architettonici: accesso all'infrastruttura, accelerazione delle applicazioni e orchestrazione e serving. NVIDIA offre un solido stack software in grado di consentire ogni ottimizzazione simultaneamente. È più difficile di quanto sembri, ma l'effetto composito è ciò che produce miglioramenti radicali nell'output dei token consegnati. Le continue ottimizzazioni del software da parte dell'ecosistema open source e di NVIDIA rendono l'hardware esistente più produttivo nel tempo.
Il risultato di una co-progettazione estrema è il costo per token più basso del settore su GB200 NVL72.
Ottimizzare all'interno dei vincoli aziendali
La maggior parte delle aziende deve ottimizzare il costo dei token all'interno delle impronte esistenti dei data center e dei vincoli dell'ambiente. Ad esempio, la densità media di potenza dei rack è di circa 27 kilowatt (kW) e il 75% dei data center è ancora raffreddato ad aria anziché ad acqua. Le aziende hanno spesso carichi di lavoro misti al di fuori dell'IA, come ad esempio l'elaborazione di dati o grafica, e una disponibilità di capitale iniziale limitata per affrontare questi vincoli. NVIDIA offre opzioni adatte allo scopo. NVIDIA HGX™ B200 e B300 offrono il costo per token più basso per le fabbriche IA raffreddate ad aria. NVIDIA RTX PRO™ 6000 Blackwell offre un'efficienza dei token fino a 3 volte superiore rispetto ai sistemi NVIDIA Hopper della generazione precedente per i carichi di lavoro di inferenza aziendale.
Efficienza nella generazione di token
Throughput per megawatt e costo per token: le metriche che contano
La maggior parte delle organizzazioni valuta ancora l'infrastruttura IA utilizzando metriche di input come il costo per ora di GPU, il picco delle operazioni a virgola mobile al secondo (FLOPS) o FLOPS al dollaro. Queste sono le metriche sbagliate per valutare l'infrastruttura IA. Quattro misurazioni che confrontano NVIDIA Blackwell e Hopper sono la giustificazione:
Le metriche che contano di più sono il throughput per MW e il costo per token.
Il throughput per MW influisce sui ricavi e il costo per token determina la redditività per interazione e la velocità con cui un'azienda può crescere. Queste metriche acquisiscono le prestazioni dell'hardware, l'ottimizzazione del software e l'utilizzo nel mondo reale in una singola metrica. Per un trattamento più approfondito del costo totale di proprietà dell'inferenza, consulta Ripensare il TCO dell'IA: perché il costo per token è l'unica metrica che conta.
Con la maturazione dell'IA agentica, emergono idee adiacenti insieme al costo per token: intelligenza per token, token per attività e costo per attività. Il costo per attività è una funzione dell'efficienza con cui un modello genera intelligenza (intelligenza per token) e dell'efficienza con cui un modello utilizza i token per completare un'attività (token per attività).
L'utilità definisce il valore di un token. La domanda prevede quanti token verranno consumati e da chi. L'offerta decide quanto costa produrre.
La monetizzazione riunisce questi tre pilastri e risponde alla domanda aziendale centrale: come viene stabilito il prezzo e venduto i token in modo che l'economia sia favorevole e sostenibile?
Non esiste un singolo modello economico per come monetizzare i token. Sono emerse quattro strategie chiave, ciascuna adatta a diversi contesti aziendali e punti di partenza.
I meccanismi di prezzo che seguono si basano sulla vendita diretta di token. Per i prodotti e i servizi basati su token, l'approccio è concettualmente simile, sebbene le organizzazioni debbano anche tenere conto del valore aggiuntivo che offrono al cliente finale.
Ottenere i principi di base per la determinazione dei prezzi è fondamentale a prescindere dal modello che l'organizzazione persegue.
Come determinare il prezzo dei token
Nel determinare il prezzo dei token, considera tre fattori importanti:
In definitiva, i ricavi dei token dipendono dall'output dei token, dal prezzo dei token e dalla distribuzione della domanda tra i vari livelli di prezzo. I margini di profitto dipendono dal costo per produrre token. Le decisioni sull'infrastruttura sono quindi direttamente rilevanti per i ricavi. La piattaforma NVIDIA Vera Rubin aumenta il throughput e riduce il costo per token di 10 volte. Inoltre, Vera Rubin con LPX offre carichi di lavoro altamente interattivi e altamente intelligenti che hanno prezzi premium, espandendo sia le opportunità di guadagno che i margini al vertice dello spettro dei prezzi.
I seguenti casi di studio illustrano come le organizzazioni stiano mettendo in pratica queste strategie in ciascuno dei quattro modelli: vendere token direttamente, creare offerte native IA, migliorare i prodotti e i servizi esistenti e trasformare le operazioni interne. I numeri sulle prestazioni e sull'efficienza presentati in precedenza in questa guida evidenziano ciò che è possibile ottenere con una co-progettazione completa. I casi di studio che seguono mostrano alle organizzazioni in varie fasi di questo percorso, in cui i risultati riflettono la combinazione specifica di selezione di modelli, lunghezze di sequenza, precisione numerica, ottimizzazioni per l'inferenza e hardware distribuito.
Riepilogo
Cohere, fondata nel 2019, è un'azienda leader nel settore dell'IA sovrana che crea modelli di base e prodotti end-to-end per risolvere i problemi aziendali del mondo reale. Cohere lavora su entrambi i lati dell'economia dei token: l'azienda crea i propri modelli e l'azienda crea i prodotti e le soluzioni che utilizzano tali modelli. La famiglia principale di modelli linguistici di grandi dimensioni (LLM) di Cohere è la famiglia di modelli Command/North, che include Command A Vision (multimodale) e Command A Translate, oltre a Embed e Rerank per la ricerca.
Cohere ha inoltre sviluppato North, uno spazio di lavoro IA aziendale sicuro in cui i dipendenti lavorano a fianco di agenti IA personalizzabili che cercano i dati aziendali con RAG, utilizzano strumenti, eseguono flussi di lavoro e alimentano le automazioni.
Obiettivo
Poiché North viene eseguito sui modelli di Cohere, ogni interazione richiede token ed è sensibile alla latenza, quindi l'efficienza dell'inferenza guida direttamente i margini di Cohere e la qualità dei prodotti. Per questo motivo, Cohere ha bisogno della migliore infrastruttura IA per fornire il costo per token più basso, ridurre la latenza e ottenere un elevato throughput per nodo. Cohere esegue un programma di benchmarking continuo su modelli, hardware e livelli di carico.
Soluzione
Cohere ha spostato i suoi modelli di produzione da NVIDIA H100 a NVIDIA Blackwell B200 e GB200, in genere eseguiti con una precisione FP8.
Risultati
Nei benchmark interni di Cohere che confrontano NVIDIA H100 con NVIDIA B200, il team ha riscontrato che:
Grafico a barre che mostra il guadagno nel throughput di picco con B200 rispetto a H100 (fino a 64 utenti).
I guadagni tecnici portano valore aziendale
Un throughput più elevato per nodo e una latenza inferiore si traducono in margini e in un prodotto migliore.
Nel complesso, Cohere ha ottenuto margini migliori, maggiore scalabilità, maggiore flessibilità e una migliore esperienza per il cliente fornendo i propri modelli e soluzioni su NVIDIA Blackwell.
Per illustrare, la tabella seguente mostra l'impatto aziendale generale che Cohere ha ottenuto con NVIDIA Blackwell.
Nota: il throughput misurato viene combinato con i prezzi delle GPU disponibili pubblicamente per illustrare la forma dell'impatto, non i costi effettivi di Cohere.
Costo illustrativo per 1 milione di token (stesso conteggio di GPU; a titolo illustrativo 3,50 USD/H100-hr e 6,00 USD/B200-hr = premio di 1,71 volte).
| Modello (scenario) | Costo H100 per 1 milione di token | Costo B200 per 1 milione di token | Guadagno di throughput | Token per dollaro |
|---|---|---|---|---|
| Command A Translate (1K/100) | 0,39 $ | 0,26 $ | 2,62x | +53% (-35% cost) |
| Command A+ (10K/1K) | 128$ | 113$ | 1,93x | +13% (-11% cost) |
| Command A Vision (1 immagine) | $1,99 | 1,83 $ | 1,87x | +9% (-8% cost) |
Guadagno in token per dollaro = guadagno in throughput / premio di prezzo per GPU. Un throughput superiore a ~1,7 volte (contesto lungo, alta simultaneità, traduzione) NVIDIA Blackwell offre un reale risparmio sul costo per token. Il vantaggio cresce con il ridursi del divario di prezzo B200/H100 (le tariffe per il cloud sono spesso più vicine a 1,5 volte).
Riepilogo
Perplexity è una piattaforma di agenti IA incentrata sull'IA accurata. La piattaforma dell'azienda sfrutta 15 modelli IA, tra cui NVIDIA Nemotron™ 3 Ultra, instradando ogni carico di lavoro attraverso la pipeline al modello con la migliore soluzione in termini di costo e qualità per ottimizzare prestazioni, qualità e costi per i nostri clienti.
"Ogni generazione di hardware NVIDIA ci ha acquistato qualcosa di specifico. NVIDIA Hopper ci ha permesso di servire la nostra flotta di modelli. NVIDIA Blackwell, con il dominio NVLink più ampio e MXFP8 sui Tensor Core, ci consente di servire su più nodi senza pagare per la latenza. Ecco cosa rende i carichi di lavoro verso cui ci stiamo muovendo". – Denis Yarats, Co-fondatore e CTO, Perplexity
Obiettivo
L'obiettivo aziendale di Perplexity è quello di offrire un'IA accurata a livello consumer, preservando al contempo l'economia necessaria all'affidabilità e alla crescita di livello aziendale. L'infrastruttura di produzione di Perplexity gestisce già più di 50 milioni di query al giorno su una flotta di 15 modelli, dal 50° percentile al first token (P50 TTFT), variando da 2,4 secondi per la ricerca rapida a circa 13 secondi per il lavoro di ragionamento approfondito. Poiché sempre più traffico si trasforma in lavoro agentico di diverse ore in Perplexity Computer, Perplexity rende ogni unità di intelligenza più economica, veloce e affidabile, quindi i costi e la latenza aumentano sublingualmente con il traffico e la complessità delle attività.
Soluzione
L'infrastruttura IA di Perplexity è basata su più generazioni di hardware NVIDIA, tra cui NVIDIA Hopper e NVIDIA Blackwell, ed è orchestrata e ottimizzata con lo stack software per data center di NVIDIA.
Perplexity ha basato il proprio stack di inferenza su NVIDIA per ridurre il costo per token senza sacrificare l'accuratezza o la latenza. Le prestazioni di ogni generazione successiva di GPU migliorano significativamente e, in combinazione con FlashInfer, CuTe DSL, SHARP, la quantizzazione MXFP8 e il serving di pre-riempimento e decodifica disaggregati, sono in grado di estrarre più token per ora di GPU.
Risultati
Perplexity ha ottenuto un miglioramento di circa 2-4 volte del costo dei token di output su una GB200 multi-nodo rispetto a una H200 a nodo singolo, riducendo al contempo la latenza di dispatch del 46,5% sui modelli MoE.
Latenza ridotta
Il grafico seguente confronta la latenza di dispatch MoE su H200 e GB200 utilizzando i trasporti NVLink e NVLS, mostrando che GB200 con NVLS riduce la latenza di dispatch del 46,5% rispetto all'H200 con NVLS (313,3 μs rispetto a 586,1 μs).
Perplexity
Throughput migliorato
Il grafico successivo mostra il throughput di decodifica per GPU rispetto alla velocità di decodifica per GB200 (EP = 4/8/16) e H200 (EP = 8/16), mostrando che le distribuzioni multi-nodo GB200 offrono un throughput per GPU migliorato di 2-4 volte rispetto all'H200 a nodo singolo a velocità di decodifica corrispondenti, grazie al dominio NVLink più ampio.
Perplexity
Riepilogo
La missione di Canva è quella di supportare la progettazione al mondo. La suite di strumenti di progettazione IA di Canva può aiutare chiunque a fare il proprio lavoro al meglio, dai post sui social media alle presentazioni e ai brevi video. Tra le funzionalità più popolari della suite Design c'è il generatore IA image-to-video, che trasforma una foto fissa in una breve clip animata, senza bisogno di software e funzionando su qualsiasi dispositivo.
"Lavorare con NVIDIA aiuta Canva a migliorare l'efficienza delle esperienze creative basate sull'IA, dall'immagine al video, preservando al contempo la velocità e la qualità che i nostri utenti si aspettano. Questa efficienza è la chiave per rendere gli strumenti creativi avanzati accessibili a più persone". – Stefano Corazza, Responsabile della ricerca IA, Canva
Obiettivo
Canva ha attualmente oltre 265 milioni di utenti attivi al mese, rendendola una delle tre applicazioni IA più utilizzate al mondo. Per rendere il popolare generatore IA image-to-video a disposizione di tutti, Canva ha creato un'infrastruttura di inferenza specializzata basata su NVIDIA. Ciò garantisce che i video generati soddisfino i più elevati standard di settore, mantenendo al contempo il costo per generazione e la latenza a livelli ragionevoli.
Soluzione
Canva esegue il proprio stack di inferenza image-to-video su NVIDIA per ridurre i costi per generazione senza sacrificare l'accuratezza o la latenza. La funzione è basata su un modello video con trasformatore di diffusione, servito su NVIDIA B200. Grazie alle pipeline di inferenza distribuita e post-elaborazione ottimizzate in combinazione con kernel specializzati per hardware, Canva offre più video generati per ora di GPU, consentendo di estendere l'esperienza gratuita da immagine a video a una base di utenti globale.
Risultati
Canva era in grado di ottenere il 70% in più di generazioni video per ora di GPU su B200 rispetto alle H200.
Come utilizzare questo foglio di lavoro: compila ogni [_blank_] con il numero appropriato. Gli output di ogni livello alimentano il livello successivo. La matematica sotto ogni sezione mostra esattamente cosa viene moltiplicato e come i numeri si susseguono in cascata.
Livello 1: domanda di base
Stiamo dimensionando questa distribuzione per [__________] utenti, ognuno dei quali esegue circa [__________] attività ogni giorno. Una richiesta tipica invia [__________] token di input e il modello restituisce [__________] token di output.
Input
A. Utenti ..................... [__________]
B. Attività per utente al giorno ........ [__________]
C. Lunghezza della sequenza di input (ISL) ...... [________] token
D. Lunghezza della sequenza di output (OSL) ...... [__________] token
La matematica
Sessioni / Giorno = A × B
= [_____] × [_____]
= [_______________] sessioni/giorno
Token / Richiesta = C + D
= [_____] + [_____]
= [_______________] token/richiesta
Token di base / Giorno = Sessioni × Token/Richiesta
= [_____] × [_____]
= [_______________] token/giorno
Token di base / Mese = Giornaliero × 30
= [_______________] token/mese
Livello 2: moltiplicatori per il carico di lavoro
Ogni fase brucia circa [__________] token di ragionamento nascosti e una singola attività catena attraverso [_____] passaggi dell'agente. Gli errori e i fallback aggiungono un overhead di [_____]× per ritentare e alleghiamo un prompt di sistema a [__________] token a ogni chiamata. Il prompt caching sta colpendo il [_____]% dei token di prompt di sistema.
Input
E. Token di ragionamento per passaggio ....... [__________]
F. Passaggi dell'agente per attività ........ [_____]
G. Moltiplicatore ............ [_____] ×
H. Token del prompt di sistema per passaggio ... [__________]
I. Tasso di successo della cache .............. [_____] %
La matematica
Token regolati / Richiesta = Token/Ric + E
= [_____] + [_____]
= [_______________]
Token / Attività (con passaggi) = Regolati × F
= [_____] × [_____]
= [_______________]
Token / Attività (con nuovi tentativi) = Sopra × G
= [_____] × [_____]
= [_______________]
Risparmi di cache / Giorno = H × (I / 100) × F × Sessioni
= [_____] × [_____] × [_____] × [_____]
= [_______________] token salvati/giorno
Token effettivi / Giorno = (Token/Attività × Sessioni) − Risparmi di cache
= [_____] − [_____]
= [_______________] token/giorno
Token effettivi / Mese = Giornaliero × 30
= [_______________] token/mese
Livello 3: plasmazione operativa
Circa il [_____]% del traffico giornaliero atterra all'interno di una finestra aziendale di [_____] ore. All'interno di questo picco, il traffico reale aumenta fino a [_____]× la media finestrata, mentre i picchi stagionali ci estendono di un ulteriore [_____]×. Per soddisfare gli SLA di latenza, mantieni [_____]× margine aggiuntivo.
Input
J. Concentrazione all'ora di picco ......... [_____] %
K. Ore di picco ........... [_____] ore
L. Rapporto di burst ................. [_____] ×
M. Fattore di picco stagionale ........... [_____] ×
N. Margine SLA per la latenza ............ [_____] ×
La matematica
Media TPM (24 ore) = Giornaliero effettivo ÷ 1,440
= [_____] ÷ 1,440
= [_______________] token/min
Media TPM (finestra di picco) = (Giornaliero effettivo × J/100) ÷ (K × 60)
= ([_____] × [_____]) ÷ ([_____] × 60)
= [_______________] token/min
Picco di burst TPM = Picco TPM × L
= [_____] × [_____]
= [_______________] token/min
Picco TPM + SLA = Burst × N
= [_____] × [_____]
= [_______________] token/min
Picco TPM + Stagionale = Sopra × M
= [_____] × [_____]
= [_______________] token/min
La tokenomics di NVIDIA si concentra sull'ottimizzazione dei costi e dei ricavi della generazione di token IA per watt, con l'obiettivo di ridurre il costo complessivo per token attraverso architetture come NVIDIA Blackwell e Vera Rubin. Per discutere dei prezzi dell'infrastruttura o della licenza software, puoi contattarci tramite il modulo sottostante.