KI-Trainingslösungen
Vom Pre-Training bis zum Post-Training: NVIDIA-beschleunigtes Computing optimiert die Trainingszeit, die Trainingskosten und den Trainings-Goodput im Produktionsmaßstab.
Überblick
Offene Frontier-Modelle, geschlossene und Branchenmodelle basieren auf NVIDIA. Durch ein extremes Co-Design in den Bereichen Rechenleistung, Netzwerke, Datenspeicher, Speicher und Software bietet NVIDIA branchenführende Verarbeitungsleistung pro Watt und kontinuierliche Optimierungen. Dies beschleunigt die Trainingszeit, senkt die Trainingskosten und ermöglicht agentische Funktionen für Modellentwickler.
Egal, ob es sich um das Pre-Training eines MoE-Modells (Mixture-of-Experts) mit Billionen Parametern handelt, das Post-Training eines Reasoning-Agenten mit bestärkendem Lernen oder die Feinabstimmung eines fachspezifischen Forschers: Die beschleunigte Computing-Plattform von NVIDIA bietet Training im Produktionsmaßstab für die weltweit führenden KI-Unternehmen.
Benchmarks
Die NVIDIA-Plattform zeichnete sich durch die schnellste Trainingszeit und höchste Leistung pro GPU in MLPerf Training 6.0-Benchmarks aus. In dieser Runde legte NVIDIA Ergebnisse sowohl auf GB200 NVL72- als auch auf GB300 NVL72-Systemen vor. Bei gleichem Maßstab ermöglichte GB300 NVL72 ein bis zu 1,6-mal schnelleres Training als GB200 NVL72. Diese Runde wurde um zwei neue Mixture-of-Experts-Pre-Training-Workloads erweitert: DeepSeek-V3 671B und GPT-OSS-20B. Bei beiden Workloads stellte NVIDIA Leistungsrekorde auf. Auf DeepSeek-V3 671B skalierte NVIDIA auf 8.192 GPUs mit GB200 NVL72-Systemen, der bisher größten Blackwell-basierten Einreichung in MLPerf Training.
MLPerfTraining-v5.0-, v5.1- und v6.0-Ergebnisse abgerufen von www.mlcommons.org am 16. Juni 2026. MLPerf-GPU-Skalierungsergebnisse aus den Einträgen 5.0-0004, 5.1-004, 6.0-0001, 6.0-0005 und 6.0-0014. MLPerf Blackwell-Trainingsvergleich aus den folgenden Einträgen: 6.0-0006, 6.0-0013, 6.0-0017, 6.0-0018, 6.0-0078 und 5.1-0072. Der Name MLPerf und das Logo sind eingetragene und nicht eingetragene Marken der MLCommons Association in den USA und anderen Ländern. Alle Rechte vorbehalten. Die nicht autorisierte Verwendung ist strengstens untersagt. Weitere Informationen finden Sie unter www.mlcommons.org
Vorteile
Die NVIDIA-Plattform bietet schnellere Trainingszeiten, einen hohen Trainings-Goodput und einen vollständigen Software-Stack, der sich kontinuierlich für laufende Leistungsverbesserungen optimiert.
NVIDIA Blackwell bietet bis zu 3-mal schnelleres Training und fast 2-mal mehr Trainingsleistung pro Dollar als die vorherige Generation. NVIDIA gewinnt jeden MLPerf-Training-Benchmark, vom LLM-Pre-Training bis hin zur Feinabstimmung bei neuronalen Graphen-Netzen, und baut seine Führungsrolle mit jeder Software-Version weiter aus.
NVIDIA NeMo™ RL mit End-to-End-FP8-Präzision sorgt für einen höheren Rollout-Durchsatz und eine stabile Konvergenz für bestärkendes Lernen (RL) im Produktionsmaßstab. Trainieren Sie Multi-Umgebungs-Multi-Turn-Agenten, die kontinuierlich lernen und die gleiche Genauigkeit wie BF16 zu einem Bruchteil der Kosten bieten.
Hybrider Expert-Parallelismus, NVFP4-Präzision und NVL72-Scale-up machen NVIDIA zur bevorzugten Plattform für die weltweit intelligentesten MoE-Modelle – von offenen OSS-Modellen bis hin zu proprietären Frontier-Systemen. Mehr Parameter schneller mit demselben Energieverbrauch trainieren.
Von NVIDIA-Bibliotheken wie Megatron-Core und NeMo bis hin zu Branchen-Frameworks wie PyTorch, JAX, vLLM, SGLang und Ray: Jedes wichtige Trainings-, Post-Training- und Inferenz-Framework wird nativ auf NVIDIA ausgeführt. Offene Gewichte, offene Rezepte, offene Beiträge: 1,5 Millionen KI-Modelle auf Hugging Face laufen auf NVIDIA® CUDA®.
Produkte
NVIDIA bietet extremes Co-Design in den Bereichen Rechenleistung, Netzwerke, Datenspeicher, Arbeitsspeicher und KI-Software und ist damit die einzige vertikal integrierte, horizontal offene KI-Trainingsplattform der Branche.
Anwendungsbeispiele
KI-Modelle vortrainieren, um ihnen grundlegende Funktionen zu geben, wie das Verständnis von Sprache, die Audio-, Video- oder Bilderkennung oder die Identifizierung von Beziehungen in Daten, bevor sie an bestimmte Aufgaben angepasst werden. Maximieren Sie den Goodput von KI-Trainings, indem Sie systemweite Zustandsprüfungen ermöglichen, Fehler zur Laufzeit schnell erkennen und das Training automatisch fortsetzen.
Trainieren Sie Reasoning-Agenten und Tool-basierte Modelle mit NeMo RL, was End-to-End-FP8-Rollouts, spekulative Decodierung und Multi-Environment-Training umfasst. NeMo RL wird von führenden KI-Labors genutzt, um die Ära der agentischen KI voranzutreiben.
Passen Sie offene Foundation-Modelle wie Nemotron, Meta Llama, Mistral und Google Gemma 4 mit den Rezepten von NeMo AutoModel und kuratierten Datensätzen an fachspezifische Anwendungen an. NeMo AutoModel ist Hugging-Face-nativ, PyTorch-nativ und wird in jedem NVIDIA-Cloud- und lokalen Cluster unterstützt.
Ressourcen
Entdecken Sie die technischen Blogs von NVIDIA, On-Demand-Sessions und Entwicklervideos, um mehr über KI-Trainingsinfrastruktur, Benchmarks und Best Practices zu erfahren.
Fallstudien
Von KI-Labors auf dem neuesten Stand bis hin zu führenden Unternehmen – die ehrgeizigsten Teams weltweit nutzen NVIDIA, um intelligentere Modelle schneller zu trainieren.
Die NVIDIA Full-Stack-Plattform unterstützt Pre-Training, Post-Training mit bestärkendem Lernen und die überwachte Feinabstimmung im Produktionsmaßstab und optimiert so die Trainingszeit, die Trainingskosten und den Goodput in Frontier-, Open- und Unternehmens-KI-Modellen.
Die beschleunigte Computing-Plattform von NVIDIA umfasst NVIDIA Blackwell Ultra- und Rubin-GPUs, Vera- und Grace-CPUs, eine NVLink- und NVSwitch-Scale-up-Fabric, ConnectX und BlueField-DPU-SuperNICs sowie Spectrum-X-Netzwerke – alles mit extremem Co-Design für das Training von Frontier-KI-Modellen mit Billionen von Parametern.
NVIDIA unterstützt PyTorch, JAX, vLLM, SGLang und Ray nativ sowie proprietäre Bibliotheken, einschließlich Megatron Core, NeMo RL, NeMo AutoModel und NCCL. Über 1,5 Millionen Hugging-Face-Modelle werden auf CUDA ausgeführt.
Führende KI-Labore, KI-Native, Startups und Unternehmen – einschließlich OpenAI, xAI, Arcee AI, Roche, Eli Lilly und Hudson River Trading – trainieren Frontier-Modelle und fachspezifische Modelle auf NVIDIA Blackwell-basierten Systemen.
NVIDIA Blackwell sorgt für bis zu 3-mal schnelleres Training und eine fast 2-mal höhere Trainingsleistung pro Dollar im Vergleich zur Vorgängergeneration und gewinnt jeden MLPerf-Training-Benchmark in den Bereichen LLM-Pre-Training, Feinabstimmung und neuronale Graph-Netze.
Trainieren Sie Frontier-Modelle mit validierten KI-Infrastruktur-Lösungen und -Blueprints von NVIDIA-Partnern.
Erhalten Sie die neuesten Forschungsergebnisse, Benchmark-Ergebnisse und Erfolgsgeschichten direkt in Ihren Posteingang.