Slurm HPC と AI オーケストレーション向けの標準

Slurm: オープンソース HPC と AI ワークロード マネージャー

HPC と AI オーケストレーションの標準。

概要

オープンソース ワークロード管理

Slurm は、ほぼあらゆるワークロードを効率的に管理し、大規模で実績のあるスループットを実現するために構築されたオープンソース ワークロード マネージャーです。 コントローラ、ノード、パーティションで構成される階層構造を使用して、ポリシーとリソースに基づいてジョブを割り当て、ワークロード分散の最適化を行い、クラスター利用を最大化し、効率的なジョブ実行を確保します。 ハイパフォーマンス コンピューティング (HPC) と AI に関する深い専門知識を持つ SchedMD (現在は NVIDIA の一部) のエンジニアによって開発および維持されている Slurm は、TOP500 の上位 100 システムの半数以上で採用されているスケジューラーです。

Slurm のサポートを受ける

Slurm と Slinky のサポート、トレーニング、コンサルティング サービスが NVIDIA から利用できるようになりました。 実装からカスタマイズまで、Slurm を最大限に活用するために、エンジニアリング チームから直接のサポートを受けることができます。

Kubernetes 向け Slurm

Slinky は、Slurm の機能を Kubernetes に導入するための強力なツール セットを提供します。 これにより、HPC、クラウド ネイティブ、AI トレーニング ワークロードを管理するための柔軟性と使いやすさがユーザーに提供されます。

Slurm とは何ですか?

Slurm は、世界最大級のスーパーコンピューティングと AI 環境の多くに信頼されている HPC と AI 向けの市場をリードするオープン ソース ワークロード マネージャーです。

Slurm は、リソース (コンピューティング ノード) への排他的および/または非排他的アクセスを一定期間ユーザーに割り当て、ユーザーが作業を実行できるようにします。 割り当てられたノードのセット上で作業 (通常は並列ジョブ) を開始、実行、監視するためのフレームワークを提供します。 最後に、Slurm は保留中の作業のキューを管理することで、リソースに対する競合するリクエストを調停します。

特徴

Slurm の詳細を見る

世界トップクラスのスーパーコンピューター向けのワークロード マネージャー。

HPC と AI クラスター向けの実績のある拡張性とスループット

主要なワークロード マネージャーにより、最大規模のヘテロジニアス CPU と GPU クラスター全体にわたる数百万ものジョブを効率的に管理します。 小規模なラボからリーダーシップ クラスのエクサスケール スーパーコンピューターまで、環境全体で高い利用率と一貫性のあるパフォーマンスを実現します。

最適化されたリソースの配分

複雑なポリシー管理、サービス品質、組織のサービス レベル契約や優先事項に合わせたバランスの取れたリソース割り当てを含む、洗練されたスケジューリングと優先順位付け機能により、ジョブの実行を高速化し、生産性を向上させます。

高度なトポロジーの認識と計画

複雑なネットワークおよびシステム トポロジーを Slurm が理解することで、それを活用し、マルチティア相互接続上に効率的なワークロードを配置できるようにします。 遅延の最小化および、帯域幅の最大化で、エンドツーエンドのジョブ パフォーマンスを向上させます。

広くアクセス可能: オンプレミスとクラウド環境でのデプロイ

透明性のあるコード、アクティブ開発、効率的なコスト、アジャイル イノベーション、強力なユーザー コミュニティを提供するオープンソース ワークロード マネージャーで、時間の経過とともに構築および拡張します。 オンプレミス、クラウド、ハイブリッド デプロイをサポートします。

Slurm をダウンロード

Slurm は完全にオープンソースであり、ハードウェアに依存せず、リソース管理とジョブ スケジューリングにおいて完全な透明性と柔軟性を提供します。Slurm をデプロイし、その成長に貢献し、インフラストラクチャ スタックにシームレスに統合してください。

GitHub で確認し、コミュニティに参加しましょう!

テクノロジ

リソース管理とジョブ スケジューリング

Slurm の基盤はリソースの割り当て、保留中の作業の管理、ジョブの実行ですが、Slurm が HPC および AI ワークロード向けの主要な管理システムになれたのは、そのアーキテクチャのおかげです。

GPU リソース管理

最先端の GPU リソース管理により、Slurm はユーザーが GPU と CPU リソースをリクエストできるようにし、ジョブが最大限に活用されながら迅速かつ効率的に実行されるようにします。

クラウド統合

Slurm は、REST (Representational State Transfer) API と主要なクラウド プロバイダーとの統合により可能になった自動スケーリングとハイブリッド クラウド バーストを使用して、キューの深さとジョブ要件に基づいてクラウド インスタンスを自動的に起動します。

ハードウェア非依存

Slurm は、さまざまなワークロードを実行する最新のヘテロジニアスなデータ センター向けに設計された、幅広いハードウェアのサポートにより、ほぼ全ての CPU または GPU によって高速化されたクラスターで実行されます。

ユース ケース

Slurm によるワークロードの管理

研究ラボやフロンティア AI リーダーから信頼されるオープンソース ワークロード マネージャーを使用して、コンピューティング リソースを管理する方法をご覧ください。

大規模システム

数十万個のコア、数百万個のジョブ、多様なハードウェアを同時に管理するには、基本的なスケジューリング以上の要素が必要です。 Slurm は、階層型ジョブ キュー、トポロジー認識型ルーティング、スループットを最大化するインテリジェントなジョブ パッキングにより、極めて高い同時処理性を処理します。 組み込みの電力管理、ポリシー適用、詳細なレポート機能により、あらゆる規模の大規模なデプロイを効率的かつ責任を持って運用できます。

HPC と AI トレーニング

大規模な AI モデルをトレーニングしたり、マルチ物理シミュレーションを実行したりする際には、ジョブ配置はコンピューティング性能そのものと同様に重要です。Slurm のトポロジー認識型スケジューリングは、ネットワーク ファブリック内で物理的に最も近いノードにジョブを割り当て、通信オーバーヘッドを削減することでパフォーマンスを向上させ、マルチレイヤー相互接続上のマルチノード ワークロードをプランニングします。GPU 認識およびポリシーに基づくリソース割り当てと組み合わせることで、チームは優先度の低いジョブや不適切に配置されたジョブを待つことなく、分散ワークロードを予測可能に実行できます。

Kubernetes クラスター

Slinky は、Kubernetes 環境で Slurm の運用を可能にするコンポーネントのツールキットであり、従来の HPC とクラウド ネイティブ環境とのギャップを埋めます。チームは、共有ノード プールで Slurm と Kubernetes ワークロードを実行し、Kubernetes リソース リクエストを Slurm ジョブに変換できます。 これにより、研究者や開発者は、Slurm の優れたバッチ スケジューリングとリソース ガバナンスの恩恵を享受しながら、使い慣れた Kubernetes ワークフローを利用できます。

FAQ

Slurm に関する FAQ

オープンソース ワークロード マネージャーは、クラスターやクラウド環境などの共有インフラストラクチャ全体でコンピューティング ジョブのスケジューリング、実行、監視を自動化するソフトウェアです。 オープンソースであるため、組織はサブスクリプションやエンタープライズ ライセンスなしで、パフォーマンス、拡張性、運用ニーズに合わせて自由に使用、カスタマイズ、拡張できます。

TOP500 は、世界で最も強力な非分散コンピューター システムのランキングです。Slurm は、TOP500 リストの上位 100 システムの半数以上で選択されているスケジューラーであり、大規模な環境におけるその実績のある拡張性とスループットを強調しています。

Slurm は、最先端クラスの GPU リソース管理を提供しており、ユーザーは GPU と CPU の両方のリソースをリクエストすることで、利用率を最大化しながらジョブを迅速かつ効率的に実行できるようにします。

ユーザーおよび管理者向けの公式クイック スタート ガイド、リリース ノート、その他の詳細なドキュメントは、SchedMD (現在は NVIDIA の一部) の Web サイトでご覧ください。 NVIDIA は、Slurm の統合と機能に関連する技術ブログ投稿とオンデマンド ビデオも提供しています。1

サポート チケットは、SchedMD (現在は NVIDIA の一部) ウェブサイトのサポート ポータルを通じて送信できます。 サポート権限を検証するには、組織のドメインのメール アドレスが必要です。Slurm と Slinky のサポート、トレーニング、コンサルティング サービスは NVIDIA から利用できます。 これにより、実装とカスタマイズのための専門家によるエンジニアリング チームへの直接の支援が提供されます。2

Slurm は、複雑なネットワークとシステム トポロジに関する理解を活用し、マルチティア相互接続上でのワークロードの効率的な配置を可能にします。これにより、遅延を最小限に抑え、帯域幅を最大化し、エンドツーエンドのジョブ パフォーマンスを向上させます。これは、HPC および AI トレーニング ワークロードにとって特に重要なことです。

SchedMD (現在は NVIDIA の一部) は、Kubernetes 環境で Slurm の運用を可能にするコンポーネントのオープンソース ツールキットとして Slinky を開発し、従来の HPC とクラウド ネイティブ環境のギャップを埋めました。 これにより、チームは共有ノード プールで Slurm と Kubernetes ワークロードを実行し、Kubernetes リソース リクエストを Slurm ジョブに変換できます。3

Slurm は、大規模な並列ジョブのキューベースのバッチ スケジューリング向けに最適化されており、スループットとハードウェア効率を優先します。 Kubernetes は、コンテナ化されたマイクロサービスの宣言型でイベント主導のオーケストレーション向けに設計されています。4

関連情報

ワークロード管理の最新情報

オープンソース Slurm で次世代 AI ワークロードをオーケストレーション

この GTC San Jose 2026 セッションでは、Slurm がスーパーコンピューティング ワークロードの効率、移植性、相互運用性の向上を支援している現在のアーキテクチャ、最近の機能強化、コミュニティ主導の継続的な取り組みについて掘り下げました。

Slurm で Kubernetes 上で大規模な GPU ワークロードを実行

ほとんどの組織は、Slurm ジョブ スクリプトに長年にわたる投資をしており、2 つの別々の環境を維持することなく Kubernetes に移行する際に課題を感じています。オープンソース プロジェクトの Slinky は、大規模な Kubernetes 環境を管理する新しいアプローチを提供します。

ハードウェアからトポロジー認識スケジューリングまで

AI アーキテクトと HPC オペレーターは、ラック設置型ハードウェアをエンドユーザー向けに安全で高性能で使いやすいリソースに変えるという課題に直面しています。 NVIDIA Mission Control™ などの検証済みのソフトウェア スタックは、マルチノード スケジューリング用のツールを提供し、Slurm と Kubernetes の両方をサポートしています。

次のステップ

さっそく始めませんか?

GitHub でダウンロードして、コミュニティに参加しましょう。

Slurm サポート

最新リリースを常に把握し、Slurm エンジニアから直接サポートを受けましょう。

Slurm ドキュメント

Slurm のリリースノートとクイック スタート ガイドをご覧ください。