Slurm は、ほぼあらゆるワークロードを効率的に管理し、大規模で実績のあるスループットを実現するために構築されたオープンソース ワークロード マネージャーです。 コントローラ、ノード、パーティションで構成される階層構造を使用して、ポリシーとリソースに基づいてジョブを割り当て、ワークロード分散の最適化を行い、クラスター利用を最大化し、効率的なジョブ実行を確保します。 ハイパフォーマンス コンピューティング (HPC) と AI に関する深い専門知識を持つ SchedMD (現在は NVIDIA の一部) のエンジニアによって開発および維持されている Slurm は、TOP500 の上位 100 システムの半数以上で採用されているスケジューラーです。
Slurm は、世界最大級のスーパーコンピューティングと AI 環境の多くに信頼されている HPC と AI 向けの市場をリードするオープン ソース ワークロード マネージャーです。
Slurm は、リソース (コンピューティング ノード) への排他的および/または非排他的アクセスを一定期間ユーザーに割り当て、ユーザーが作業を実行できるようにします。 割り当てられたノードのセット上で作業 (通常は並列ジョブ) を開始、実行、監視するためのフレームワークを提供します。 最後に、Slurm は保留中の作業のキューを管理することで、リソースに対する競合するリクエストを調停します。
世界トップクラスのスーパーコンピューター向けのワークロード マネージャー。
Slurm は完全にオープンソースであり、ハードウェアに依存せず、リソース管理とジョブ スケジューリングにおいて完全な透明性と柔軟性を提供します。Slurm をデプロイし、その成長に貢献し、インフラストラクチャ スタックにシームレスに統合してください。
GitHub で確認し、コミュニティに参加しましょう!
Slurm の基盤はリソースの割り当て、保留中の作業の管理、ジョブの実行ですが、Slurm が HPC および AI ワークロード向けの主要な管理システムになれたのは、そのアーキテクチャのおかげです。
研究ラボやフロンティア AI リーダーから信頼されるオープンソース ワークロード マネージャーを使用して、コンピューティング リソースを管理する方法をご覧ください。
数十万個のコア、数百万個のジョブ、多様なハードウェアを同時に管理するには、基本的なスケジューリング以上の要素が必要です。 Slurm は、階層型ジョブ キュー、トポロジー認識型ルーティング、スループットを最大化するインテリジェントなジョブ パッキングにより、極めて高い同時処理性を処理します。 組み込みの電力管理、ポリシー適用、詳細なレポート機能により、あらゆる規模の大規模なデプロイを効率的かつ責任を持って運用できます。
大規模な AI モデルをトレーニングしたり、マルチ物理シミュレーションを実行したりする際には、ジョブ配置はコンピューティング性能そのものと同様に重要です。Slurm のトポロジー認識型スケジューリングは、ネットワーク ファブリック内で物理的に最も近いノードにジョブを割り当て、通信オーバーヘッドを削減することでパフォーマンスを向上させ、マルチレイヤー相互接続上のマルチノード ワークロードをプランニングします。GPU 認識およびポリシーに基づくリソース割り当てと組み合わせることで、チームは優先度の低いジョブや不適切に配置されたジョブを待つことなく、分散ワークロードを予測可能に実行できます。
Slinky は、Kubernetes 環境で Slurm の運用を可能にするコンポーネントのツールキットであり、従来の HPC とクラウド ネイティブ環境とのギャップを埋めます。チームは、共有ノード プールで Slurm と Kubernetes ワークロードを実行し、Kubernetes リソース リクエストを Slurm ジョブに変換できます。 これにより、研究者や開発者は、Slurm の優れたバッチ スケジューリングとリソース ガバナンスの恩恵を享受しながら、使い慣れた Kubernetes ワークフローを利用できます。
FAQ
オープンソース ワークロード マネージャーは、クラスターやクラウド環境などの共有インフラストラクチャ全体でコンピューティング ジョブのスケジューリング、実行、監視を自動化するソフトウェアです。 オープンソースであるため、組織はサブスクリプションやエンタープライズ ライセンスなしで、パフォーマンス、拡張性、運用ニーズに合わせて自由に使用、カスタマイズ、拡張できます。
TOP500 は、世界で最も強力な非分散コンピューター システムのランキングです。Slurm は、TOP500 リストの上位 100 システムの半数以上で選択されているスケジューラーであり、大規模な環境におけるその実績のある拡張性とスループットを強調しています。
Slurm は、最先端クラスの GPU リソース管理を提供しており、ユーザーは GPU と CPU の両方のリソースをリクエストすることで、利用率を最大化しながらジョブを迅速かつ効率的に実行できるようにします。
ユーザーおよび管理者向けの公式クイック スタート ガイド、リリース ノート、その他の詳細なドキュメントは、SchedMD (現在は NVIDIA の一部) の Web サイトでご覧ください。 NVIDIA は、Slurm の統合と機能に関連する技術ブログ投稿とオンデマンド ビデオも提供しています。1
サポート チケットは、SchedMD (現在は NVIDIA の一部) ウェブサイトのサポート ポータルを通じて送信できます。 サポート権限を検証するには、組織のドメインのメール アドレスが必要です。Slurm と Slinky のサポート、トレーニング、コンサルティング サービスは NVIDIA から利用できます。 これにより、実装とカスタマイズのための専門家によるエンジニアリング チームへの直接の支援が提供されます。2
Slurm は、複雑なネットワークとシステム トポロジに関する理解を活用し、マルチティア相互接続上でのワークロードの効率的な配置を可能にします。これにより、遅延を最小限に抑え、帯域幅を最大化し、エンドツーエンドのジョブ パフォーマンスを向上させます。これは、HPC および AI トレーニング ワークロードにとって特に重要なことです。
SchedMD (現在は NVIDIA の一部) は、Kubernetes 環境で Slurm の運用を可能にするコンポーネントのオープンソース ツールキットとして Slinky を開発し、従来の HPC とクラウド ネイティブ環境のギャップを埋めました。 これにより、チームは共有ノード プールで Slurm と Kubernetes ワークロードを実行し、Kubernetes リソース リクエストを Slurm ジョブに変換できます。3
Slurm は、大規模な並列ジョブのキューベースのバッチ スケジューリング向けに最適化されており、スループットとハードウェア効率を優先します。 Kubernetes は、コンテナ化されたマイクロサービスの宣言型でイベント主導のオーケストレーション向けに設計されています。4