Whitepaper
KI funktioniert durch Token. Wie Sie diese nutzen, skalieren, generieren und monetarisieren, bestimmt Ihren KI-Wettbewerbsvorteil. Wählen Sie die optimale Modell- und Kontextlänge für jeden Anwendungsfall, stellen Sie eine Infrastruktur bereit, die die Token pro Watt maximiert und die Kosten pro Token minimiert, und steigern Sie das Umsatz- und Margenwachstum in großem Maßstab.
Rechenzentren werden zu KI-Token-Fabriken. Wo sie einmal Transaktionen verarbeitet und Webseiten bereitgestellt haben, stellen sie jetzt eine neue Art von Ausgabe her: Token, die Einheit von Intelligenz, die von KI-Modellen bei der Inferenz produziert wird. Da KI vom Experiment in die Produktion übergeht, ist Inferenz zum dominanten Workload und Token zum neuen Gut geworden, das Unternehmen lernen müssen, zu produzieren, zu verwalten und zu monetarisieren.
Was ist Tokenomics? Es handelt sich um die Ökonomie der Token-Generierung und -Nutzung, ein Begriff, der häufig vom Ökosystem verwendet wird, aber manchmal an Präzision mangelt. Um genau zu verstehen, was Tokenomics wirklich bedeutet, ist es hilfreich, sich darin zu verstehen, wie Token bewertet, konsumiert, bereitgestellt und monetarisiert werden.
Die Tokenomics umfasst vier miteinander verbundene Säulen:
Die einzelen Säulen der Tokenomics existieren nicht isoliert von einander. Entscheidungen über das Angebot wirken sich direkt auf die Margen aus, Nachfrageprognosen bestimmen den Infrastrukturanforderungen und das Token-Versorgungsunternehmen setzt die Obergrenze für das, was geladen werden kann. Diese vier Säulen sind eng miteinander abhängig, und sie richtig zu setzen unterscheidet nachhaltige KI-Unternehmen von kostspieligen Experimenten. In diesem Paper werden alle diese Faktoren ausführlich untersucht und ein Framework für Unternehmen bereitgestellt, die KI-Bereitstellungen planen oder skalieren.
Nicht alle Token werden gleich erstellt. Der Wert eines Tokens hängt von zwei Dimensionen ab:
Je höher die Intelligenz und je schneller die Interaktivität, desto teurer ist die Produktion dieser Token. Der Wert, der aus diesen Token gewonnen wird, steht jedoch im Verhältnis zum Anwendungsfall und hängt vollständig davon ab, ob der Anwendungsfall sie nutzen kann. Ein nachtrainiertes Small Language Model (SLM) kann ein viel größeres, intelligenteres Modell für fachspezifische Aufgaben zu einem Bruchteil der Kosten gleichwertigen oder sogar übertreffen. Eine Pipeline für die Batch-Dokumentenverarbeitung hat sehr andere Interaktivitätsanforderungen als ein Echtzeit-Coding-Assistent. Der zusätzliche Wert lohnt sich nur, wenn die Anwendung ihn nutzen kann.
Der Token-Nutzenwert lässt sich am besten als Spektrum verstehen: von Ivity-Workloads mit hohem Durchsatz und mit geringer Interaktion, die von einfachen oder nachtrainierten SLMs bereitgestellt werden, wie Suche und Chatbot, bis hin zu nahezu Echtzeit-Workloads, die die größten Modelle mit dem längsten Kontext erfordern, wie agentische Kodierung und Automatisierung. Die strategische Aufgabe besteht darin, jeden Anwendungsfall dem richtigen Punkt in diesem Spektrum zuzuordnen.
Ein praktischer Ansatz besteht darin, zuerst einen Prototyp zu erstellen und mit Frontier-Fähigkeiten zu validieren, dann durch eine Bewertung strenge Service-Level-Ziele (SLOs) zu definieren und schließlich zu optimieren und die richtige Größe für den Maßstab zu nutzen. Zu den Fragen, die diesen Prozess leiten, gehören:
Die richtige Kartierung hat direkte nachgelagerte Konsequenzen. Es bestimmt, welche Modelle bereitgestellt werden, wie der Infrastrukturbedarf bemessen wird und letztendlich was für die produzierten Token in Rechnung gestellt wird. Der Token-Nutzenwert ist die Grundlage, auf der Entscheidungen zu Nachfrage, Angebot und Monetarisierung aufgebaut werden.
Die NVIDIA KI-Infrastruktur bietet Kunden die Flexibilität, den optimalen Token-Wert zu wählen, indem sie eine Vielzahl von proprietären und Open-Weight-Modellen unterstützt. NVIDIA entwickelt außerdem Nemotron, eine Familie von hocheffizienten, multimodalen, offenen Modellen, die für langlebige, sich selbst weiterentwickelnde Agenten entwickelt wurden. So wurden beispielsweise die Kodierungs-Benchmarks von Nemotron 3 Ultra mit weniger Token insgesamt und weniger Token pro Turn als vergleichbare Modelle abgeschlossen, wodurch die Kosten für agentische Aufgaben um bis zu 30 % gesenkt wurden.
Wie prognostizieren Sie die Token-Nachfrage? Mit dem Anwendungsfall zu beginnen, ist der effektivste Weg, um die Nachfrage als Vorhersage- und Infrastrukturplanungstool zu nutzen. Der Markt erlebt eine aggressive Ausweitung der Anwendungsfälle – von Verbraucher- und Unternehmens-Chatbots bis hin zu Programmierung und agentischer Automatisierung. Diese Verlagerung transformiert die Nachfragelandschaft schnell von einem Markt mit Billionen von Token auf Quadrillionen und verändert den Workload und die Nachfragecharakteristiken von Token und ihre Stückkosten grundlegend.
Unternehmen benötigen Methoden, um ihren eigenen Bedarf für die Planung von Kapital- und Betriebskosten im Zusammenhang mit ihren KI-Anwendungsfällen vorherzusagen. Der auf ersten Prinzipien basierende Ansatz besteht aus drei Ebenen:
Ein dreistufiges Token-Anforderung-Vorhersagemodell, von Basisschätzungen über Workload-Multiplikatoren bis hin zu betrieblichen Nachfragevariablen, die die realen Infrastrukturanforderungen bestimmen. Das dreistufige Modell mit Farbcodierung: Grün zeigt gemeinsame Komponenten mit herkömmlicher Software-Kapazitätsplanung an, und Orange hebt Variablen hervor, die nur für die Token-Bereitstellung gelten (Token pro Anfrage, Reasoning, Agenten-Loops).
Mit den Anforderungsschätzungen auf Basis von Level 1 beginnt die Kapazitätsplanung. Sie dienen als Basisverständnis der Anforderungen für Proof-of-Concept-Bereitstellungen, werden aber selten für die Produktion skaliert. Workload-Nachfrage-Multiplikatoren können die Token-Nachfrage um eine Größenordnung skalieren. Wie das folgende Beispiel zeigt, würde die Infrastruktur ausschließlich auf der Grundlage der Basis-Bedarfsschätzung bereitgestellt, die zugehörige Anwendung auf mehr als 600 Millionen Token pro Tag knapp.
Die Überlegungen zum betrieblichen Bedarf (Ebene 3) erfordern eine Modellierung des Bedarfs auf einer granulareren Ebene. Dieses Worksheet zur Token-Nachfrage-Vorhersage bietet eine Fill-in-the-Blank-Version, um Sie durch alle drei Ebenen zu führen.
Die Token-Nachfrage-Vorhersage ist weniger eine Abweichung von der herkömmlichen Software-Kapazitätsplanung, als es den Anschein hat. Die meisten Eingaben – Sessions, Anfragen, Wiederholungsversuche, Cache-Trefferraten, zeitliche Muster und Latenz-SLAs (Service Level Agreements) – werden mit Praktiken geteilt, die Infrastrukturteams bereits kennen. Drei Variablen sind einzigartig bei der Bereitstellung von Token: Token pro Anfrage, Reasoning-Overhead und Agenten-Schleifen. Was das Nachfrageprofil einer Bereitstellung von einem anderen unterscheidet, ist nicht die Methodik, sondern der Kontext: der Anwendungsfall, die Organisation, die sie bereitstellt, und die Entscheidungen über das Anwendungsdesign, die in den Workflow einbezogen werden.
Unternehmen, die diese drei Ebenen als lebendiges Modell und nicht als einmalige Übung behandeln, sind am besten aufgestellt, um die Infrastruktur richtig zu dimensionieren, da agentische Workloads skaliert und die Token-Nachfrage zusammengesetzt werden.
Bei der Token-Versorgung geht es grundsätzlich um Effizienz: Maximierung der Token-Ausgabe bei gleichzeitiger Minimierung der Kosten für die Token-Produktion.
Um dies zu erreichen, ist eine gemeinsame Optimierung der Modell-, System- und Softwareeffizienz erforderlich. Keine einzelne Komponente ist allein ausreichend. Alle drei müssen gemeinsam mit dem Ökosystem entwickelt werden. NVIDIA bezeichnet dies als „extremes Co-Design“ und umfasst Modelle und Algorithmen, Rechenleistung, Netzwerke, Speicher, Datenspeicher, Software und das Ökosystem von Partnern und Kunden, wobei jede Komponente zusammenarbeitet, um das Ganze größer als die Summe seiner Teile zu machen und es dem System ermöglicht, die niedrigsten Tokenkosten zu generieren.
Modelleffizienz
MoE-Architekturen (Mixture-of-Experts) bieten erhebliche Gewinne an Modelleffizienz, indem sie nur die relevanten Parameter für jedes Token aktivieren. Kimi K2.5 beispielsweise verfügt über 1 Billion Parameter, aktiviert jedoch nur 32 Milliarden pro Token und bietet die Intelligenz eines viel größeren dichten Modells zu einem Bruchteil der Rechenkosten. Die versteckten Kosten sind die Kommunikation zwischen Experten, die über GPUs verteilt sind. MoE-Inferenz generiert hohen All-to-All-Verkehr zwischen GPUs über Batches hinweg, und Effizienzgewinne verschwinden, wenn das zugrunde liegende System diesen Verkehr nicht in großem Maßstab bewältigen kann.
Systemeffizienz
Die NVIDIA GB200 NVL72 verbindet 72 GPUs über den NVIDIA NVLink-Switch und ermöglicht so eine All-to-All-Bandbreite von 1.800 Gigabyte pro Sekunde (GB/s). Diese größere GPU-Domain ermöglicht es, Experten auf bis zu 72 GPUs zu verteilen, ohne die Kommunikationsengpässe, die Fixed-Mesh-Konfigurationen mit einem einzigen Knoten oder handelsübliche Ethernet-basierte Scale-up-Ansätze einschränken. Dies stellt sicher, dass die theoretische Effizienz von MoE-Modellen in der Produktion realisiert wird.
Software-Effizienz
Um das volle Potenzial der Hardware zu erschließen, ist ein Software-Stack erforderlich, der über drei Architekturschichten optimiert ist: Infrastrukturzugriff, Anwendungsbeschleunigung sowie Orchestrierung und Bereitstellung. NVIDIA bietet einen robusten Software-Stack, der jede Optimierung gleichzeitig ermöglichen kann. Dies ist schwieriger, als es sich anhört, aber der Compounding-Effekt ist es, der zu schrittweisen Verbesserungen der bereitgestellten Token-Ausgabe führt. Kontinuierliche Softwareoptimierungen durch das Open-Source-Ökosystem und NVIDIA machen die bestehende Hardware im Laufe der Zeit produktiver.
Das Ergebnis extremen Co-Designs sind die branchenweit niedrigsten Kosten pro Token auf GB200 NVL72.
Optimierung innerhalb von Unternehmenseinschränkungen
Die meisten Unternehmen müssen die Tokenkosten innerhalb der bestehenden Rechenzentrumsfläche und Umgebungseinschränkungen optimieren. Beispielsweise beträgt die durchschnittliche Rack-Energiedichte etwa 27 Kilowatt (kW), und 75 % der Rechenzentren werden immer noch luftgekühlt statt wassergekühlt. Unternehmen haben außerdem häufig gemischte Workloads außerhalb des KI-Bereichs, wie Daten- oder Grafikverarbeitung, und eine begrenzte Vorabkapitalverfügbarkeit, um diese Einschränkungen zu bewältigen. NVIDIA bietet zweckdienliche Optionen. Die NVIDIA HGX B200 und B300 bieten die niedrigsten Tokenkosten für luftgekühlte KI-Fabriken. Die NVIDIA RTX PRO 6000 Blackwell bietet eine bis zu 3-fache Tokeneffizienz der NVIDIA Hopper-Systeme der vorherigen Generation für Inferenz-Workloads in Unternehmen.
Effizienz der Token-Generierung
Durchsatz pro Megawatt und Kosten pro Token: Die entscheidenden Metriken
Die meisten Unternehmen bewerten die KI-Infrastruktur immer noch mit Eingabe-Metriken wie Kosten pro GPU-Stunde, Spitzen-Gleitkomma-Operationen pro Sekunde (FLOPS) oder FLOPS pro Dollar. Dies sind die falschen Metriken für die Bewertung der KI-Infrastruktur. Vier Messungen, die NVIDIA Blackwell und Hopper vergleichen:
Die Metriken, die am wichtigsten sind, sind der Durchsatz pro MW und die Kosten pro Token.
Der Durchsatz pro MW wirkt sich auf Ihren Umsatz aus, und die Kosten pro Token bestimmen die Rentabilität pro Interaktion und wie schnell ein Unternehmen wachsen kann. Diese Metriken erfassen die Hardware-Leistung, die Softwareoptimierung und die reale Auslastung in einer einzigen Metrik. Eine tiefere Behandlung der Inferenz-Gesamtbetriebskosten finden Sie unter KI-TCO neu denken: Warum die Kosten pro Token die einzige Metrik sind, die zählt.
Während agentische KI ausgereift ist, entstehen neben den Kosten pro Token auch benachbarte Ideen: Intelligenz pro Token, Token pro Aufgabe und Kosten pro Aufgabe. Die Kosten pro Aufgabe hängen davon ab, wie effizient ein Modell Intelligenz generiert (Intelligenz pro Token) und wie effizient ein Modell Token nutzt, um eine Aufgabe zu erledigen (Token pro Aufgabe).
Der Nutzen definiert, was ein Token wert ist. Nachfrageprognosen, wie viele Token verbraucht werden und von wem. Das Angebot entscheidet, wie viel die Produktion kostet.
Die Monetisierung bringt diese drei Säulen zusammen und beantwortet die zentrale Geschäftsfrage: Wie legen Sie den Preis fest und verkaufen Sie Token, damit die wirtschaftlichen Rahmenbedingungen günstig und nachhaltig sind?
Es gibt kein einziges Wirtschaftsmodell für die Monetarisierung von Token. Es sind vier wichtige Strategien entstanden, die jeweils für verschiedene Geschäftskontexte und Ausgangspunkte geeignet sind.
Die folgende Preismechanik basiert auf dem direkten Verkauf von Token. Für Produkte und Dienstleistungen, die auf Token basieren, ist der Ansatz konzeptionell ähnlich, obwohl Unternehmen auch den zusätzlichen Mehrwert berücksichtigen müssen, den sie dem Endkunden bieten.
Die richtigen Grundlagen der Preisgestaltung ist entscheidend, unabhängig davon, welches Modell ein Unternehmen verfolgt.
So bestimmen Sie die Token-Preise
Berücksichtigen Sie bei der Preisfestsetzung von Token drei wichtige Faktoren:
Letztendlich hängt der Token-Umsatz von der Token-Produktion, dem Token-Preis und der Verteilung der Nachfrage über die Preisstufen ab. Die Gewinnmargen hängen von den Kosten für die Produktion von Token ab. Infrastrukturentscheidungen sind daher direkt für den Umsatz relevant. Die NVIDIA Vera Rubin-Plattform steigert den Durchsatz und senkt die Kosten pro Token um das Zehnfache. Darüber hinaus ermöglicht Vera Rubin mit LPX hochinteraktive, hochintelligente Workloads, die für Premium-Preise sorgen und sowohl die Umsatzchancen als auch die Margen am oberen Ende des Preisspektrums erweitern.
Die folgenden Fallstudien zeigen, wie Unternehmen diese Strategien in jedem der vier Modelle in die Praxis umsetzen: Direktverkauf von Token, Entwicklung KI-nativer Angebote, Verbesserung bestehender Produkte und Dienstleistungen und Transformation interner Abläufe. Die zuvor in diesem Leitfaden präsentierten Leistungs- und Effizienzzahlen zeigen, was mit vollständigem Co-Design erreichbar ist. Die folgenden Fallstudien zeigen Unternehmen in verschiedenen Phasen dieses Weges, wobei die Ergebnisse ihre spezifische Kombination aus Modellauswahl, Sequenzlängen, numerischer Genauigkeit, Inferenzoptimierungen und bereitgestellter Hardware widerspiegeln.
Zusammenfassung
Cohere, das 2019 gegründet wurde, ist ein führendes souveränes KI-Unternehmen, das Foundation-Modelle und End-to-End-Produkte entwickelt, um reale Geschäftsprobleme zu lösen. Kohärente Arbeit auf beiden Seiten der Token-Ökonomie: Sie entwickeln ihre eigenen Modelle und die Produkte und Lösungen, die diese Modelle nutzen. Die primäre Familie großer Sprachmodelle (LLMs) von Cohere ist die Command/North-Modellfamilie, einschließlich Command A Vision (multimodal) und Command A Translate sowie Embed und Rerank für die Suche.
Cohere entwickelte außerdem North, einen sicheren KI-Arbeitsplatz für Unternehmen, in dem Mitarbeiter neben anpassbaren KI-Agenten arbeiten, die mit RAG nach Unternehmensdaten suchen, Tools nutzen, Workflows ausführen und Automatisierungen unterstützen.
Ziel
Da North auf den eigenen Modellen von Cohere arbeitet, ist jede Interaktion token-hungrig und latenzempfindlich, sodass die Inferenzeffizienz die Margen und die Produktqualität von Cohere direkt beeinflusst. Aus diesem Grund benötigt Cohere die beste KI-Infrastruktur, um die niedrigsten Tokenkosten zu bieten, die Latenz zu reduzieren und einen hohen Durchsatz pro Knoten zu erzielen. Cohere führt ein kontinuierliches Benchmarking-Programm in den Bereichen Modelle, Hardware und Auslastungsebenen durch.
Lösung
Cohere hat seine Produktionsmodelle von NVIDIA H100 auf NVIDIA Blackwell B200 und GB200 verschoben, die in der Regel mit FP8-Genauigkeit ausgeführt werden.
Ergebnisse
In den eigenen internen Benchmarks von Cohere, in denen NVIDIA H100 mit NVIDIA B200 verglichen wurde, stellte das Team Folgendes fest:
Balkendiagramm, das die B200-Steigerung des Durchsatzpeaks im Matched-Sweep-B200 über H100 (bis zu 64 Benutzer) zeigt.
Technische Vorteile führen zu Geschäftswert
Ein höherer Durchsatz pro Knoten und eine geringere Latenz führen zu Margen und einem besseren Produkt.
Insgesamt hat Cohere bessere Margen, eine größere Skalierung, größere Flexibilität und ein besseres Kundenerlebnis erzielt, indem es seine Modelle und Lösungen auf NVIDIA Blackwell bereitstellt.
Zur Veranschaulichung zeigt die folgende Tabelle die allgemeinen geschäftlichen Auswirkungen, die Cohere mit NVIDIA Blackwell erzielt hat.
Hinweis: Der gemessene Durchsatz wird mit öffentlich verfügbaren GPU-Preisen kombiniert, um die Auswirkungen zu veranschaulichen, nicht die tatsächlichen Kosten von Cohere.
Illustrative Kosten pro 1 Million Token (gleiche GPU-Anzahl; illustrative 3,50 $/H100-Stunde und 6,00 $/B200-Stunde = 1,71-facher Preisaufschlag).
| Modell (Szenario) | H100-Kosten pro 1 Million Token | B200-Kosten pro 1 Million Token | Durchsatzgewinn | Token pro Dollar |
|---|---|---|---|---|
| Command A übersetzen (1K/100) | 0,39 $ | 0,26 $ | 2,62x | +53% (-35% cost) |
| Command A+ (10.000/1K) | 128$ | 113$ | 1,93x | +13% (-11% cost) |
| Command A Vision (1 Bild) | 1,99 $ | 1,83 $ | 1,87x | +9% (-8% cost) |
Token-pro-Dollar-Gewinn = Durchsatzgewinn / GPU-Preisaufschlag. Bei einem Durchsatz von über dem ca. 1,7-fachen (langer Kontext, hohe Gleichzeitigkeit, Übersetzung) bietet NVIDIA Blackwell echte Kosten-per-Token. Der Vorteil wächst, wenn sich die B200/H100-Preislücke verringert (die Cloud-Raten liegen oft näher am 1,5-fachen).
Zusammenfassung
Perplexity ist eine KI-Agentenplattform, die sich auf genaue KI konzentriert. Die Plattform des Unternehmens nutzt 15 KI-Modelle, darunter NVIDIA Nemotron-3 Ultra, und leitet jeden Workload durch die Pipeline an das Modell weiter, das sich am besten in Bezug auf Kosten und Qualität eignet, um Leistung, Qualität und Kosten für unsere Kunden zu optimieren.
„Jede Generation von NVIDIA-Hardware hat uns etwas Bestimmtes geboten. NVIDIA Hopper ließ uns unsere Modellflotte bereitstellen. NVIDIA Blackwell ermöglicht es uns, mit der größeren NVLink-Domäne und MXFP8 auf den Tensor-Recheneinheiten über mehrere Knoten bereitzustellen, ohne dafür Latenz zu müssen. Das macht die Workloads, die wir einführen, wirtschaftlich tragfähig.“ – Denis Yarats, Mitbegründer und CTO, Perplexity
Ziel
Das Geschäftsziel von Perplexity ist es, genaue KI im Verbrauchermaßstab bereitzustellen und gleichzeitig die für die Zuverlässigkeit und das Wachstum auf Unternehmensniveau erforderliche Wirtschaftlichkeit zu bewahren. Die Produktionsinfrastruktur von Perplexity verarbeitet bereits mehr als 50 Millionen Abfragen pro Tag in einer Flotte von 15 Modellen, mit einem 50. Perzentil Time to First Token (P50 TTFT), wobei die Dauer von 2,4 Sekunden bei der schnellen Suche bis zu ca. 13 Sekunden bei der Deep Reasoning Reality-Arbeit reicht. Da sich im Perplexity Computer ein größerer Teil dieses Verkehrs in stundenlange agentische Arbeit verlagert, macht Perplexity jede Einheit der Intelligenz billiger, schneller und zuverlässiger, sodass Kosten und Latenz frühzeitig mit der Komplexität des Verkehrs und der Aufgaben skaliert werden können.
Lösung
Die KI-Infrastruktur von Perplexity basiert auf mehreren Generationen von NVIDIA-Hardware, einschließlich NVIDIA Hopper und NVIDIA Blackwell, und wird mit dem Rechenzentrums-Software-Stack von NVIDIA orchestriert und optimiert.
Perplexity hat seinen Inferenz-Stack auf NVIDIA entwickelt, um die Kosten pro Token zu senken, ohne die Genauigkeit oder Latenz zu beeinträchtigen. Die Leistung jeder nachfolgenden GPU-Generation verbessert sich erheblich und in Kombination mit FlashInfer, CuTe DSL, SHARP, MXFP8-Quantisierung sowie disaggregiertem Prefill- und Dekodierungsbereitstellung sind sie in der Lage, mehr Token pro GPU-Stunde zu extrahieren.
Ergebnisse
Perplexity erzielte eine etwa 2- bis 4-fache Verbesserung der Ausgabetokenkosten mit GB200 mit mehreren Knoten gegenüber H200 mit einem einzigen Knoten und reduzierte gleichzeitig die Bereitstellungslatenz um 46,5 % bei MoE-Modellen.
Reduzierte Latenz
Die folgende Grafik vergleicht die MoE-Bereitstellungslatenz über H200 und GB200 mit NVLink- und NVLS-Transporten und zeigt, dass GB200 mit NVLS die Bereitstellungslatenz um 46,5 % gegenüber H200 mit NVLS verkürzt (313,3 μs gegenüber 586,1 μs).
Perplexity
Verbesserter Durchsatz
Das nächste Diagramm zeigt den Dekodierungsdurchsatz pro GPU gegenüber der Dekodierungsgeschwindigkeit für GB200 (EP = 4/8/16) und H200 (EP = 8/16) und zeigt, dass GB200-Multi-Node-Bereitstellungen dank der größeren NVLink-Domäne einen 2- bis 4-mal verbesserten Durchsatz pro GPU im Vergleich zu H200-Single-Node bei abgestimmten Dekodierungsgeschwindigkeiten erreichen.
Perplexity
Zusammenfassung
Die Mission von Canva ist es, die Welt des Designs zu ermöglichen. Die Suite von KI-Design-Tools von Canva kann jedem helfen, seine beste Arbeit zu leisten – von Social-Media-Posts bis hin zu Präsentationen und kurzen Videos. Zu den beliebtesten Funktionen der Design-Suite gehört der Image-to-Video-KI-Generator, der ein Standfoto in einen kurzen animierten Clip verwandelt, der keine Software benötigt und auf jedem Gerät funktioniert.
„Die Arbeit mit NVIDIA hilft Canva, die Effizienz KI-gestützter kreativer Erlebnisse wie Image-to-Video zu verbessern und gleichzeitig die Geschwindigkeit und Qualität zu erhalten, die unsere Benutzer erwarten. Diese Effizienz ist der Schlüssel, um fortschrittliche Kreativtools für mehr Menschen zugänglich zu machen.“ – Stefano Corazza, Head of AI Research, Canva
Ziel
Canva hat derzeit über 265 Millionen monatlich aktive Benutzer, was es zu einer der drei am häufigsten verwendeten KI-Anwendungen weltweit macht. Um den beliebten KI-Generator für die Bild-zu-Video-Verarbeitung allen zugänglich zu machen, hat Canva eine spezialisierte Inferenzinfrastruktur entwickelt, die von NVIDIA unterstützt wird. Dadurch wird sichergestellt, dass die generierten Videos die höchsten Branchenstandards erfüllen und gleichzeitig die Kosten pro Generation und die Latenz auf einem angemessenen Niveau halten.
Lösung
Canva führt seinen Image-to-Video-Inferenz-Stack auf NVIDIA aus, um die Kosten pro Generation zu senken, ohne die Genauigkeit oder Latenz zu beeinträchtigen. Die Funktion wird von einem Diffusionstransformator-Videomodell unterstützt, das auf NVIDIA B200s bereitgestellt wird. Dank optimierter verteilter Inferenz- und Nachverarbeitungspipelines in Kombination mit hardwarespezifischen Kernels bietet Canva mehr generierte Videos pro GPU-Stunde, sodass die kostenlose Image-to-Video-Erfahrung auf eine globale Benutzerbasis skaliert werden kann.
Ergebnisse
Canva war in der Lage, 70 % mehr Videogenerationen pro GPU-Stunde bei B200s im Vergleich zu H200s zu erzielen.
So verwenden Sie dieses Worksheet: Füllen Sie jedes [_blank_] mit der entsprechenden Nummer aus. Die Ausgaben jeder Ebene werden in die nächste Ebene eingespeist. Die Mathematik unter jedem Abschnitt zeigt genau, was multipliziert wird und wie die Zahlen kaskadieren.
Ebene 1: Basisnachfrage
Wir stellen diese Bereitstellung für [__________] Benutzer bereit, die jeden Tag etwa [__________] Aufgaben ausführen. Eine typische Anfrage sendet [____________] Eingabe-Token und das Modell gibt [__________] Ausgabe-Token zurück.
Eingaben
A. Benutzer ................................. [__________]
B. Aufgaben pro Benutzer pro Tag ........ [__________]
C. Eingabesequenzlänge (ISL) ...... [__________] Token
D. Ausgabesequenzlänge (OSL) ...... [____________] Token
Die Mathematik
Session/Tag = A × B
= [_____] × [_____]
= [_______________] Session/Tag
Token/Anfrage = C + D
= [_____] + [_____]
= [_______________] Token/Anfrage
Basis-Token/Tag = Sessions × Token/Anfrage
= [_____] × [_____]
= [_______________] Token/Tag
Basis-Token/Monat = Täglich × 30
= [_______________] Token/Monat
Ebene 2: Workload-Multiplikatoren
Jeder Schritt verbraucht etwa [__________] versteckte Reasoning-Token und eine einzige Aufgabe, die durch [_____] Agentenschritte hindurch geführt wird. Fehler und Fallbacks fügen einem [_____]× Neuversuche-Overhead hinzu, und wir fügen jedem Aufruf einen [__________] Token-System-Prompt hinzu. Das Prompt Caching betrifft [_____] % der vom System Prompt ausgestellten Token.
Eingaben
E. Reasoning-Token pro Schritt ....... [__________]
F. Agentenschritte pro Aufgabe ............ [_____]
G. Multiplikator erneut versuchen ................ [_____] ×
H. Token für die System-Prompt pro Schritt... [__________]
I. Cache-Trefferrate .................. [_____] %
Die Mathematik
Angepasst Token/Anfrage = Token/Anfrage + E
= [_____] + [_____]
= [_______________]
Token/Aufgabe (mit Schritten) = Angepasst × F
= [_____] × [_____]
= [_______________]
Token/Aufgabe (mit Wiederholungen) = Oben × G
= [_____] × [_____]
= [_______________]
Cache-Speicherungen/Tag = H × (I / 100) × F × Sessions
= [_____] × [_____] × [_____] × [_____]
= [_______________] Gespeicherte Token/Tag
Effektive Token/Tag = (Token/Aufgabe × Sessions) − Cache-Speicherungen
= [_____] − [_____]
= [_______________] Token/Tag
Effektive Token/Monat = Täglich × 30
= [_______________] Token/Monat
Ebene 3: Betriebliche Gestaltung
Etwa [_____] % des täglichen Verkehrs landen innerhalb eines [_____]stündigen Geschäftsfensters. Innerhalb dieser Spitze setzen reale Traffic-Bursts bis zum [_____]× auf den Window-Average und saisonale Spitzen uns noch [_____]× unter Druck. Um Latenz-SLAs zu erfüllen, sollten Sie [_____]× zusätzlichen Headroom beibehalten.
Eingaben
J. Konzentration in der Spitzenstunde ......... [_____] %
K. Spitzenzeitenfenster ............... [_____] Stunden
L. Burst-Verhältnis ......................... [_____] ×
M. Saisonaler Spitzenfaktor ........... [_____] ×
N. SLA-Headroom für Latenz ............ [_____] ×
Die Mathematik
Durchschnittliches TPM (24-Stunden) = Effektiv täglich ÷ 1.440
= [_____] ÷ 1.440
= [_______________] Token/Min
Durchschnittliches TPM (Spitzen-Fenster) = (Effektiv täglich × J/100) ÷ (K × 60)
= ([_____] × [_____]) ÷ ([_____] × 60)
= [_______________] Token/Min
Spitzen-Burst-TPM = Spitzen-TPM × L
= [_____] × [_____]
= [_______________] Token/Min
Spitzen-TPM + SLA = Burst × N
= [_____] × [_____]
= [_______________] Token/Min
Spitzen-TPM + Saisonal = Oben × M
= [_____] × [_____]
= [_______________] Token/Min
NVIDIA Tokenomics konzentriert sich auf die Optimierung der Kosten und des Umsatzes bei der Generierung von KI-Token pro Watt und zielt darauf ab, die Gesamtkosten pro Token durch Architekturen wie NVIDIA Blackwell und Vera Rubin zu senken. Um die Infrastrukturpreise oder die Softwarelizenz zu besprechen, können Sie sich über das folgende Formular an uns wenden.