백서
AI는 토큰으로 실행됩니다. 이를 어떻게 사용하고, 확장하며, 생성하며, 수익화를 하는지에 따라 AI 경쟁 우위가 결정됩니다. 각 사용 사례에 대해 최적의 모델과 컨텍스트 길이를 선택하고, 와트당 토큰을 극대화하고 토큰당 비용을 최소화하는 인프라를 배치하며, 대규모 수익과 마진 성장을 주도하세요.
데이터센터는 AI 토큰 팩토리로 바뀌고 있습니다. 이전에는 트랜잭션을 처리하고 웹페이지를 제공했지만, 이제는 새로운 종류의 출력, 즉 추론 중에 AI 모델이 생성하는 인텔리전스 단위인 토큰을 제조합니다. AI가 실험에서 프로덕션으로 전환됨에 따라, 추론은 지배적인 워크로드가 되었으며, 토큰은 기업이 생산, 관리, 수익화하기 위해 배워야 하는 새로운 상품이 되었습니다.
토크노믹스란 무엇인가요? 토큰 생성 및 사용의 경제학을 바탕으로 생태계에서 자주 사용되는 용어이지만, 정밀도가 부족할 수 있습니다. 토크노믹스가 실제로 의미하는 바를 자세히 알아보려면 토큰이 어떻게 평가되고, 소비되며, 공급되며, 수익화되는지 설명하는 것이 도움이 됩니다.
토크노믹스는 상호 연결된 4개의 핵심 요소를 포괄합니다.
토크노믹스의 각 축은 격리되어 존재하지 않습니다. 공급에 대한 결정은 마진에 직접적인 영향을 미치며, 수요 예측은 인프라 요구 사항을 결정하며, 토큰 유틸리티는 충전할 수 있는 것에 대한 상한선을 설정합니다. 이러한 4개의 축은 깊이 상호 의존적이며, 이를 올바르게 수행하는 것이 지속 가능한 AI 비즈니스를 비용이 많이 드는 실험과 분리하는 것입니다. 이 백서에서는 각 항목을 심층적으로 살펴보고, 기업이 AI 배치를 계획하거나 확장할 수 있도록 프레임워크를 제공합니다.
모든 토큰이 동일하게 생성되는 것은 아닙니다. 토큰의 값은 다음 두 가지 차원에 따라 달라집니다.
인텔리전스와 상호작용 속도가 높을수록 토큰을 생산하는 비용이 더 많이 듭니다. 그러나 이러한 토큰으로부터 수집되는 가치는 사용 사례에 따라 결정되며, 사용 사례가 이를 활용할 수 있는지 여부에 따라 전적으로 달라집니다. 사후 학습된 소규모 언어 모델(SLM)은 훨씬 더 크고 지능적인 모델을 초과하거나 낮은 비용으로 도메인별 작업을 수행할 수 있습니다. 배치 문서 처리 파이프라인은 실시간 코딩 어시스턴트와 매우 다른 상호작용 요구 사항을 갖습니다. 추가 가치는 애플리케이션이 사용할 수 있는 경우에만 지불할 가치가 있습니다.
토큰 유틸리티는 검색 및 챗봇과 같은 기본 또는 사후 학습된 SLM이 제공하는 고처리량, 저상호작용 워크로드부터 에이전틱 코딩 및 자동화와 같은 가장 긴 컨텍스트를 갖춘 최대 규모의 모델을 필요로 하는 실시간에 가까운 워크로드에 이르기까지 스펙트럼으로 이해하는 것이 가장 좋습니다. 전략적 작업은 각 사용 사례를 해당 스펙트럼의 올바른 지점에 매핑하는 것입니다.
실용적인 접근 방식은 먼저 최첨단 기능을 갖춘 프로토타입 및 검증을 수행한 다음 평가를 통해 엄격한 서비스 수준 목표(SLO)를 정의한 다음 마지막으로 규모에 맞게 최적화하고 적정 규모를 조정하는 것입니다. 이러한 프로세스를 안내하는 데 도움이 되는 질문은 다음과 같습니다.
이러한 매핑을 올바르게 수행하면 다운스트림에 직접적인 결과를 가져옵니다. 이를 통해 배치되는 모델, 인프라 요구 사항을 결정하는 방법, 궁극적으로 생성된 토큰에 대해 무엇을 청구해야 할지 결정됩니다. 토큰 유틸리티는 수요, 공급, 수익화 결정을 내리는 기반입니다.
NVIDIA AI 인프라는 광범위한 독점 및 오픈웨이트 모델을 지원하여 고객이 최적의 토큰 값을 선택할 수 있는 유연성을 제공합니다. NVIDIA는 장기적으로 실행되는 자체 진화하는 에이전트를 위해 구축된 고효율의 멀티모달 개방형 모델 제품군인 Nemotron을 구축합니다. 예를 들어 Nemotron 3 Ultra는 유사 모델보다 더 적은 총 토큰과 1회당 더 적은 토큰으로 코딩 벤치마크를 완료하여 에이전틱 작업의 비용을 최대 30%까지 절감했습니다.
토큰 수요를 어떻게 예측하나요? 사용 사례로 시작하는 것이 수요를 예측 및 인프라 계획 도구로 활용할 수 있는 가장 효과적인 방법입니다. 시장은 소비자 및 엔터프라이즈 챗봇부터 코딩 및 에이전틱 자동화에 이르기까지 사용 사례가 적극적으로 확장되고 있습니다. 이러한 변화는 수요 환경을 수조 개의 토큰에서 4조개의 토큰으로 신속하게 변화시키고 있으며, 워크로드와 토큰의 수요 특성과 단가의 근본적인 변화로 변화시키고 있습니다.
기업은 AI 사용 사례와 관련된 자본 및 운영 지출을 계획하기 위한 자체 수요를 예측할 수 있는 방법론이 필요합니다. Morpheus의 첫 번째 원칙 기반 접근 방식은 다음 세 가지 수준으로 구성됩니다.
워크로드 승수를 통한 기본 추정부터 실제 인프라 요구 사항을 형성하는 운영 수요 변수에 이르기까지 3계층 토큰 수요 예측 모델입니다. 색상 코딩을 갖춘 3레벨 모델: Green은 기존 소프트웨어 용량 계획과 공유되는 구성 요소를 나타내며, Orange는 토큰 서빙에 고유한 변수(요청당 토큰, 추론, 에이전트 루프)를 강조합니다.
레벨 1을 기반으로 한 수요 추정치는 용량 계획을 시작하는 곳입니다. 개념 증명 배치를 위한 요구 사항에 대한 베이스라인 이해의 역할을 하지만, 프로덕션으로 확장되는 경우는 거의 없습니다. 워크로드-수요 승수는 토큰 수요를 100% 확장할 수 있습니다. 아래 예제와 같이 기본 수요 추정치를 기반으로 인프라를 프로비저닝했다면 관련 애플리케이션은 하루 6억 개 이상의 토큰이 부족할 수 있습니다.
운영 수요(계층 3) 고려 사항을 고려하면 더 세분화된 수준에서 수요를 모델링해야 합니다. 이 토큰 수요 예측 워크시트는 세 가지 레벨 모두를 안내할 수 있는 빈 채우기 버전을 제공합니다.
토큰 수요 예측은 보기만 하면 기존 소프트웨어 용량 계획과 거의 벗어납니다. 세션, 요청, 재시도, 캐시 적중률, 일시적 패턴, 지연 서비스 수준 계약(SLA)을 포함한 대부분의 입력 내용은 인프라 팀이 이미 알고 있는 관행으로 공유됩니다. 요청당 토큰 수, 추론 오버헤드, 에이전트 루프의 세 가지 변수는 토큰 서빙에 고유합니다. 한 배치의 수요 프로필을 다른 것들과 차별화하는 것은 방법론이 아니라 컨텍스트, 즉 사용 사례, 이를 배치하는 조직, 워크플로우에 적용되는 애플리케이션 설계 결정입니다.
이러한 세 가지 수준을 일회성 운동이 아닌 살아있는 모델로 취급하는 조직은 에이전틱 워크로드의 확장과 토큰의 수요가 증가함에 따라 적절한 규모의 인프라를 구축할 수 있는 최적의 위치에 있습니다.
토큰 공급은 근본적으로 효율성에 관한 것입니다. 즉 토큰 생산 비용을 최소화하면서 토큰 출력을 극대화합니다.
이를 달성하려면 모델 효율성, 시스템 효율성, 소프트웨어 효율성 전반에 걸쳐 공동 최적화가 필요합니다. 하나의 구성 요소만으로는 충분하지 않습니다. 세 가지 모두 에코시스템과 함께 설계되어야 합니다. NVIDIA는 이를 “극한의 공동 설계”라고 부르며, 모델과 알고리즘, 컴퓨팅, 네트워킹, 메모리, 스토리지, 소프트웨어, 파트너와 고객 생태계를 포괄하며, 각 구성 요소가 함께 작동하여 전체 부분을 합한 것보다 더 크게 만들어 시스템이 최저 토큰 비용을 생성할 수 있도록 지원합니다.
모델 효율성
전문가 혼합(MoE) 아키텍처는 모든 토큰에 대해 관련 매개변수만 활성화하여 모델 효율성을 크게 향상시킵니다. 예를 들어 Kimi K2.5는 1조 개의 매개변수를 가지고 있지만 토큰당 320억 개밖에 활성화되지 않으며, 컴퓨팅 비용의 일부로 훨씬 더 큰 밀도 모델을 구현할 수 있는 인텔리전스를 제공합니다. 숨겨진 비용은 GPU 전반에 걸쳐 분산된 전문가 간의 통신입니다. MoE 추론은 배치 전반에 걸쳐 GPU 간에 많은 올투올(all-to-all) 트래픽을 생성하며, 기본 시스템이 대규모 트래픽을 처리할 수 없다면 효율성 향상은 사라질 것입니다.
시스템 효율성
NVIDIA GB200 NVL72는 NVIDIA NVLink™ Switch를 통해 72개의 GPU를 연결하여 초당 1,800기가바이트(GB/s)의 올투올 대역폭을 가능하게 합니다. 이러한 더 큰 GPU 도메인을 통해 고정된 메쉬, 단일 노드 구성이나 기존 이더넷 기반 스케일 업 접근 방식을 제한하는 통신 병목 현상 없이 최대 72개의 GPU에 전문가를 분산할 수 있습니다. 이를 통해 MoE 모델의 이론적 효율성이 프로덕션 환경에서 실현될 수 있습니다.
소프트웨어 효율성
하드웨어의 잠재력을 최대한 실현하려면 인프라 액세스, 애플리케이션 가속화, 오케스트레이션 및 서빙의 세 가지 아키텍처 계층 전반에 걸쳐 최적화된 소프트웨어 스택이 필요합니다. NVIDIA는 모든 최적화를 동시에 가능하게 할 수 있는 강력한 소프트웨어 스택을 제공합니다. 이는 생각보다 어렵지만, 복잡한 효과로 제공되는 토큰 출력의 단계적인 변화를 가져옵니다. 오픈 소스 에코시스템과 NVIDIA의 지속적인 소프트웨어 최적화는 시간이 지남에 따라 기존 하드웨어의 생산성을 높입니다.
극도의 공동 설계의 결과는 GB200 NVL72에서 업계 최저 토큰당 비용을 달성합니다.
엔터프라이즈 제약 내에서 최적화
대부분의 기업은 기존 데이터 센터 설치 공간과 환경 제약 내에서 토큰 비용을 최적화해야 합니다. 예를 들어, 평균 랙 전력 밀도는 약 27킬로와트(kW)이며, 데이터 센터의 75%는 여전히 수냉식 대신 공냉식 상태입니다. 또한 기업은 데이터 또는 그래픽 처리와 같은 AI 외부의 혼합 워크로드를 보유하는 경우가 많으며, 이러한 제약을 해결하기 위한 선행 자본 가용성은 제한되어 있습니다. NVIDIA는 목적에 맞는 옵션을 제공합니다. NVIDIA HGX™ B200 및 B300은 공랭식 AI 팩토리에서 가장 낮은 토큰 비용을 제공합니다. NVIDIA RTX PRO™ 6000 Blackwell은 엔터프라이즈 추론 워크로드를 위한 이전 세대 NVIDIA Hopper™ 시스템 대비 최대 3배 향상된 토큰 효율성을 제공합니다.
토큰 생성 효율성
메가와트당 처리량과 토큰당 비용: 중요한 지표
대부분의 조직은 여전히 GPU 시간당 비용, 초당 최대 부동 소수점 연산(FLOPS), 달러당 FLOPS와 같은 입력 지표를 사용하여 AI 인프라를 평가합니다. 이러한 지표는 AI 인프라를 평가하기 위한 잘못된 지표입니다. NVIDIA Blackwell과 Hopper를 비교하는 4개의 측정 결과를 확인해 보세요.
가장 중요한 지표는 MW당 처리량과 토큰당 비용입니다.
MW당 처리량은 수익과 토큰당 비용에 영향을 미치며, 이를 통해 상호작용당 수익성과 비즈니스가 얼마나 빠르게 성장할 수 있는지 결정합니다. 이러한 지표는 하드웨어 성능, 소프트웨어 최적화, 실제 활용도를 단일 지표로 캡처합니다. 추론 총소유비용에 대한 심층적인 처리는 AI TCO 재고하기: 토큰당 비용이 유일하게 중요한 지표인 이유를 참조하세요.
에이전틱 AI가 성숙됨에 따라 토큰당 인텔리전스, 작업당 토큰, 작업당 비용과 같은 토큰당 비용과 함께 인접한 아이디어가 등장하고 있습니다. 작업당 비용은 모델이 인텔리전스(토큰당 인텔리전스)를 얼마나 효율적으로 생성하고, 모델이 토큰을 사용하여 작업을 완료하는 방법(작업당 토큰)을 나타내는 함수입니다.
유틸리티는 토큰의 가치를 정의합니다. 수요는 얼마나 많은 토큰이 누구에 의해 소비될 것인지 예측합니다. 공급량에 따라 생산 비용이 결정됩니다.
수익화는 이러한 세 가지 요소를 통합하여 주요 비즈니스 질문에 답합니다. 경제성이 유리하고 지속 가능할 수 있도록 토큰의 가격을 어떻게 책정하고 판매하나요?
토큰을 수익화하는 방법을 위한 단일 경제 모델은 없습니다. 각각 다른 비즈니스 컨텍스트와 출발점에 적합한 4개의 주요 전략이 등장했습니다.
뒤에 나오는 가격 책정 메커니즘은 토큰을 직접 판매하는 것을 기반으로 합니다. 토큰을 기반으로 구축된 제품 및 서비스의 경우 접근 방식은 개념적으로 유사하지만, 조직은 최종 고객에게 제공하는 추가 가치를 설명해야 합니다.
조직이 추구하는 모델에 관계없이 가격 기본을 올바르게 설정하는 것은 기본입니다.
토큰 가격 결정 방법
토큰의 가격을 책정할 때 세 가지 중요한 요소를 고려하세요.
궁극적으로 토큰 수익은 토큰 출력, 토큰 가격, 가격 계층 전반의 수요 분포에 따라 달라집니다. 이익률은 토큰을 생산하는 비용에 따라 달라집니다. 따라서 인프라 결정은 수익과 직접적으로 관련이 있습니다. NVIDIA Vera Rubin 플랫폼은 처리량을 높이고 토큰당 비용을 10배 낮춥니다. 또한 LPX를 갖춘 Vera Rubin은 프리미엄 가격을 요구하는 상호작용성이 높고 인텔리전스 워크로드를 실현하여 가격 스펙트럼의 상단에서 수익 기회와 마진을 모두 확장합니다.
다음 사례 연구는 조직이 토큰 직접 판매, AI 네이티브 제품 구축, 기존 제품 및 서비스 향상, 내부 운영 혁신이라는 4가지 모델에 걸쳐 이러한 전략을 실현하고 있는 방법을 보여줍니다. 이 가이드의 앞부분에서 제시된 성능 및 효율성 수치는 전체 공동 설계를 통해 달성할 수 있는 것을 강조합니다. 후속 사례 연구에서는 이러한 여정의 다양한 단계에 있는 조직을 보여주며, 결과는 모델 선택, 시퀀스 길이, 수치 정밀도, 추론 최적화, 배치된 하드웨어의 특정 조합을 반영합니다.
요약
2019년에 설립된 Cohere는 실제 비즈니스 문제를 해결하기 위한 파운데이션 모델과 엔드투엔드 제품을 구축하는 선도적인 소버린 AI 기업입니다. Cohere는 토큰 경제의 양측면에서 작동합니다. 그들은 자체 모델을 구축하고 이러한 모델을 사용하는 제품과 솔루션을 구축합니다. Cohere의 주요 거대 언어 모델(LLM) 제품군은 Command A Vision(멀티모달)과 Command A Translate를 포함한 Command/North 모델 제품군으로, 검색을 위한 Embed 및 Rerank를 포함합니다.
Cohere는 또한 안전한 엔터프라이즈 AI 워크스페이스인 North를 개발했습니다. 직원들이 RAG로 회사 데이터를 검색하고, 도구를 사용하며, 워크플로우를 실행하며, 자동화를 구동하는 맞춤형 AI 에이전트와 함께 작업하는 안전한 엔터프라이즈 AI 워크스페이스입니다.
목표
North가 Cohere의 자체 모델로 실행되므로 모든 상호작용은 토큰이 많고 지연 시간에 민감하기 때문에 추론 효율성은 Cohere의 마진과 제품 품질을 직접 주도합니다. 이러한 이유로 Cohere는 최저 토큰 비용을 제공하고, 지연 시간을 줄이며, 노드당 높은 처리량을 달성할 수 있는 최고의 AI 인프라를 필요로 합니다. Cohere는 모델, 하드웨어, 로드 수준 전반에 걸쳐 지속적인 벤치마킹 프로그램을 실행합니다.
솔루션
Cohere는 프로덕션 모델을 NVIDIA H100에서 NVIDIA Blackwell B200 및 GB200으로 이전했으며, 일반적으로 FP8 정밀도로 실행되었습니다.
결과
NVIDIA H100과 NVIDIA B200을 비교하는 Cohere의 내부 벤치마크에서 팀은 다음을 발견했습니다.
H100(최대 사용자 64명)에 비해 B200이 일치하는 최대 처리량 향상을 보여주는 막대 그래프.
기술 향상 비즈니스 가치 창출을
노드당 처리량이 높고 지연 시간이 낮으면 마진과 더 나은 제품으로 변환됩니다.
Cohere는 NVIDIA Blackwell에서 모델과 솔루션을 제공하여 더 나은 마진, 더 큰 규모, 더 큰 유연성, 더 나은 고객 경험을 달성했습니다.
설명하기 위해 아래 표는 Cohere가 NVIDIA Blackwell로 달성한 일반적인 비즈니스 영향을 보여줍니다.
참고: 측정된 처리량은 공개된 GPU 가격과 결합되어 영향의 형태를 설명합니다. Cohere의 실제 비용이 아닙니다.
100만 개의 토큰당 예제 비용(동일한 GPU 수, 예제 3.50달러/H100-hr 및 6.00달러/B200-hr = 1.71배 가격 프리미엄).
| 모델(시나리오) | 1M 토큰당 H100 비용 | 1M 토큰당 B200 비용 | 처리량 향상 | 달러당 토큰 |
|---|---|---|---|---|
| Command A Translate (1K/100) | $0.39 | $0.26 | 2.62x | +53% (-35% 비용) |
| Command A+ (10K/1K) | $0.128 | $0.113 | 1.93x | +13% (-11% 비용) |
| Command A Vision(1개 이미지) | $1.99 | $1.83 | 1.87x | +9% (-8% 비용) |
달러당 토큰-이득 = 처리량 이득 / GPU 가격 프리미엄. ~1.7배 이상의 처리량(긴 컨텍스트, 고동시성, 번역)을 갖춘 NVIDIA Blackwell은 토큰당 비용을 실질적으로 절감할 수 있습니다. B200/H100의 가격 격차가 좁혀짐에 따라 이러한 이점은 커집니다(클라우드 요금은 종종 1.5배에 가까워짐).
요약
Perplexity는 정확한 AI에 중점을 둔 AI 에이전트 플랫폼입니다. 이 회사의 플랫폼은 NVIDIA Nemotron™ 3 Ultra를 포함한 15개의 AI 모델을 활용하여, 파이프라인을 통해 각 워크로드를 최적화된 비용 품질로 모델로 라우팅하여 고객을 위해 성능, 품질, 비용을 최적화합니다.
"모든 세대의 NVIDIA 하드웨어가 구체적인 것을 구입했습니다. NVIDIA Hopper를 통해 모델 플릿을 제공할 수 있습니다. Tensor 코어에서 더 큰 NVLink 도메인과 MXFP8을 갖춘 NVIDIA Blackwell을 통해 지연 시간 없이 여러 노드에 걸쳐 서비스를 제공할 수 있습니다. 이것이 우리가 전환하는 워크로드를 경제적으로 실행 가능하게 만드는 이유입니다." – Denis Yarats, Perplexity 공동 창업자 겸 CTO.
목표
Perplexity의 비즈니스 목표는 엔터프라이즈급 신뢰성과 성장에 필요한 경제성을 유지하면서 소비자 규모로 정확한 AI를 제공하는 것입니다. Perplexity의 프로덕션 인프라는 이미 15개의 모델 전반에 걸쳐 하루 5,000만 건 이상의 쿼리를 처리하며, 50퍼센트 시간(P50 TTFT)으로 처리합니다. 빠른 검색 시간 2.4초부터 심층적인 추론 작업 시간 13초에 이르기까지 다양합니다. Perplexity는 더 많은 트래픽이 여러 시간에 걸쳐 진행되는 에이전틱 작업으로 전환됨에 따라, Perplexity는 각 인텔리전스 단위를 더 저렴하고, 빠르며, 신뢰할 수 있도록 만들어 트래픽과 작업 복잡성에 따라 비용과 지연 시간이 초기에 증가합니다.
솔루션
Perplexity의 AI 인프라는 NVIDIA Hopper 및 NVIDIA Blackwell을 포함한 여러 세대의 NVIDIA 하드웨어를 기반으로 구축되며, NVIDIA의 데이터 센터 소프트웨어 스택과 함께 오케스트레이션 및 최적화됩니다.
Perplexity는 NVIDIA를 기반으로 추론 스택을 구축하여 정확도나 지연 시간을 저하시키지 않고 토큰당 비용을 절감했습니다. 연속적인 GPU 생성 성능이 크게 향상되며, FlashInfer, CuTe DSL, SHARP, MXFP8 양자화, 분리된 프리필 및 디코딩 서빙과 함께 사용하면 GPU 시간당 더 많은 토큰을 추출할 수 있습니다.
결과
Perplexity는 멀티 노드 GB200에서 단일 노드 H200에 비해 출력 토큰 비용을 약 2~4배 개선할 수 있었으며, MoE 모델에서 디스패치 지연 시간을 46.5% 줄였습니다.
지연 시간 단축
아래 차트는 NVLink 및 NVLS 전송을 사용하여 H200과 GB200 전반에 걸쳐 MoE 디스패치 지연 시간을 비교하며, NVLS를 갖춘 GB200이 NVLS를 갖춘 H200에 비해 디스패치 지연 시간을 46.5% 단축함을 보여줍니다(313.3μs 대 586.1μs).
Perplexity
향상된 처리량
다음 차트는 GB200(EP = 4/8/16) 및 H200(EP = 8/16)의 디코딩 속도와 비교하여 GPU당 디코딩 처리량을 플로팅하여 GB200 멀티 노드 배치가 더 큰 NVLink 도메인 덕분에 동일한 디코딩 속도로 H200 단일 노드에 비해 GPU당 2~4배 향상된 처리량을 달성할 수 있음을 보여줍니다.
Perplexity
요약
Canva의 목표는 전 세계가 디자인할 수 있도록 지원하는 것입니다. Canva의 AI 설계 도구 제품군은 소셜 미디어 게시물부터 프레젠테이션 및 짧은 영상에 이르기까지 누구나 최선을 다할 수 있도록 지원할 수 있습니다. Design 제품군의 가장 인기 있는 기능 중 하나는 정지 사진을 짧은 애니메이션 클립으로 변환하는 이미지 영상 변환 AI 생성기로, 소프트웨어 없이도 모든 장치에서 작동합니다.
"NVIDIA와 협력하여 Canva는 이미지와 영상과 같은 AI 기반 크리에이티브 경험의 효율성을 개선하는 동시에 사용자가 기대하는 속도와 품질을 유지할 수 있습니다. 이러한 효율성은 더 많은 사람들이 고급 크리에이티브 도구에 액세스할 수 있도록 하는 핵심입니다." – Stefano Corazza, Canva AI 연구 책임자
목표
Canva는 현재 2억6,500만 명 이상의 월간 활성 사용자를 보유하고 있으며, 세계에서 가장 널리 사용되는 세 개의 AI 애플리케이션 중 하나입니다. 인기 있는 이미지-영상 AI 생성기를 모든 사람이 사용할 수 있도록 하기 위해 Canva는 NVIDIA를 기반으로 하는 특수 추론 인프라를 구축했습니다. 이를 통해 생성된 영상이 가장 높은 산업 표준을 충족하는 동시에 세대당 비용과 지연 시간을 합리적인 수준으로 유지할 수 있습니다.
솔루션
Canva는 NVIDIA에서 이미지-영상-투-추론 스택을 실행하여 정확도나 지연 시간을 희생하지 않으면서 세대당 비용을 절감합니다. 이 기능은 NVIDIA B200에서 제공되는 확산 트랜스포머 영상 모델을 기반으로 합니다. 최적화된 분산형 추론과 사후 처리 파이프라인 덕분에 Canva는 GPU 시간당 더 많은 영상을 생성하여 글로벌 사용자 기반이 자유롭게 이미지 영상으로 변환 경험을 확장할 수 있습니다.
결과
Canva는 H200에 비해 B200에서 GPU 시간당 70% 더 많은 영상 세대를 달성할 수 있었습니다.
이 워크시트 사용 방법: 각 [_blank_]를 적절한 숫자로 채웁니다. 각 계층의 출력은 다음 계층으로 공급됩니다. 모든 섹션 아래의 수학은 무엇이 곱되는지, 숫자가 어떻게 계단적으로 나타나는지 정확하게 보여줍니다.
계층 1: 기본 수요
각 사용자마다 매일 약 [__________]개의 작업을 실행하는 [________] 사용자를 위해 이 배치의 규모를 조정하고 있습니다. 일반적인 요청은 [__________]개의 입력 토큰을 전송하며, 모델은 [__________]개의 출력 토큰을 반환합니다.
입력
A. 사용자 ......................... [__________]
B. 하루당 사용자당 작업 ........ [__________]
C. 입력 시퀀스 길이 (ISL) ...... [________] tokens
D. 출력 시퀀스 길이(OSL) ...... [________] 토큰
계산
세션 / 일 = A × B
= [_____] × [_____]
= [_______________] 토큰/일
토큰 / 요청 = C + D
= [_____] + [_____]
= [_______________] 토큰/요청
베이스 토큰 / 일 = 세션 × 토큰/요청
= [_____] × [_____]
= [_______________] 토큰/일
기본 토큰 / 월 = 일 × 30
= [_______________] 토큰/월
계층 2: 워크로드 승수
각 단계는 약 [__________]개의 숨겨진 추론 토큰을 구동하며, 단일 작업은 [_____] 개의 에이전트 단계를 거쳐 연결됩니다. 실패와 폴백으로 인해 [_____]× 재시도 오버헤드가 추가되며, 모든 호출에 [__________] 토큰 시스템 프롬프트를 첨부합니다. 프롬프트 캐싱은 시스템 프롬프트 토큰의 [_____]%를 차지하고 있습니다.
입력
E. 단계당 토큰의 추론 ....... [__________]
F. 작업당 에이전트 단계 ............ [_____]
G. 다시 시도 승수. ............ [_____] ×
H. 스텝당 시스템 프롬프트 토큰 ... [__________]
I. 캐시 적중률 ........................ [_____] %
계산
조정된 토큰 / 요청 = 토큰/요청 + E
= [_____] + [_____]
= [_______________]
토큰 / 작업 (단계와 함께) = 조정됨 × F
= [_____] × [_____]
= [_______________]
토큰 / 작업 (재시도와 함께) = 상위 × G
= [_____] × [_____]
= [_______________]
캐시 절감양 / 일 = H × (I / 100) × F × 세션
= [_____] × [_____] × [_____] × [_____]
= [_______________] 절약된 토큰/일
효과적인 토큰 / 일 = (토큰/작업 × 세션) − 절약된 캐시
= [_____] − [_____]
= [_______________] 토큰/일
효과적인 토큰 / 월 = 일 × 30
= [_______________] 토큰/월
계층 3: 운영 형성
일일 트래픽의 약 [_____]%가 [_____] 시간 비즈니스 윈도우 내에 도착합니다. 그 최고치 내부에서 실제 트래픽은 [_____]× 평균에 이르며, 계절별 스파이크는 또 다른 [_____]× 증가합니다. 지연 시간 SLA를 충족하려면 [_____]× 여분의 헤드룸을 유지하세요.
입력
J. 피크 아워 집중도 ......... [_____] %
K. 최대 창 시간 ................... [_____] 시간
L. 버스트 비율 ......................... [_____] ×
M. 계절별 스파이크 요인 ........... [_____] ×
N. 지연 시간 SLA 헤드룸 ............ [_____] ×
계산
평균 TPM (24시간) = 효과적 일 ÷ 1,440
= [_____] ÷ 1,440
= [_______________] 토큰/분
평균 TPM (피크 창) = (효과 일 × J/100) ÷ (K × 60)
= ([_____] × [_____]) ÷ ([_____] × 60)
= [_______________] 토큰/분
피크 버스트 TPM = 피크 TPM × L
= [_____] × [_____]
= [_______________] 토큰/분
피크 TPM + SLA = 버스트 × N
= [_____] × [_____]
= [_______________] 토큰/분
피크 TPM + 시즌별 = 상위 × M
= [_____] × [_____]
= [_______________] 토큰/분
NVIDIA 토크노믹스는 와트당 AI 토큰을 생성하는 비용과 수익을 최적화하는 데 중점을 두며, NVIDIA Blackwell 및 Vera Rubin과 같은 아키텍처를 통해 토큰당 전반적인 비용을 절감하는 것을 목표로 합니다. 인프라 가격이나 소프트웨어 라이선스에 대해 논의하려면 아래 양식을 통해 문의할 수 있습니다.