Slurm HPC 與 AI 協調的標準

Slurm:開源 HPC 與 AI 工作負載管理器

HPC 與 AI 協調的標準。

概覽

開源工作負載管理

Slurm 是一款開源工作負載管理工具,專為高效管理幾乎任何工作負載而打造,可大規模提供實證傳輸量。 它採用由控制器、節點與分區組成的層次結構,根據原則與資源分配作業、最佳化工作負載分配、最大化叢集利用率,並確保高效執行作業。 Slurm 由 SchedMD (現隸屬 NVIDIA) 具備深厚高效能運算 (HPC) 與 AI 專業知識的工程師開發及維護,是 TOP500 前 100 強系統中半數以上的首選排程器。

取得 Slurm 支援

NVIDIA 現已提供 Slurm 與 Slinky 的支援、訓練與諮詢服務。從實作到客製化,皆可獲得專家的直接工程協助,充分發揮 Slurm 的潛力。

適用於 Kubernetes 的 Slurm

Slinky 提供了一套強大的工具集,可將 Slurm 的功能導入 Kubernetes。 它為使用者帶來彈性且方便好用,可管理高效能運算、雲端原生與 AI 訓練工作負載。

Slurm 是什麼?

Slurm 是一款領先業界的 HPC 與 AI 開源工作負載管理器,受全球眾多大型超級運算與 AI 環境所信賴。

Slurm 會在一段時間內為使用者分配資源 (運算節點) 的獨家和非獨家存取權限,以便他們執行工作。 接著提供框架,用於在分配節點集上啟動、執行及監控工作 (通常為平行作業)。 最後,Slurm 透過管理待處理工作佇列來仲裁相互衝突的資源要求。

產品特點

深入瞭解 Slurm

全球頂尖超級電腦的工作負載管理器。

HPC 與 AI 叢集的實證擴充性與傳輸量

透過頂尖的工作負載管理器,有效管理最大異構 CPU 與 GPU 叢集的數百萬個作業。 從小型實驗室到頂尖級、百萬兆級的超級電腦,在各種環境中實現高利用率與一致的效能。

最佳化資源分配

透過精密的排程與優先順序管理功能加快作業執行並提升生產力,包括複雜的政策管理、服務品質保證,以及符合組織服務等級協議與優先順序的均衡資源配置。

進階拓撲感知與規劃

善用 Slurm 對複雜網路與系統拓撲的理解,在多層互連上實現高效的工作負載配置。 將延遲降至最低、將頻寬最大化,並提升端到端作業效能。

廣泛存取:內部部署與雲端部署

利用開源工作負載管理器,隨著時間建置與擴充,該管理器提供透明的程式碼、主動開發、高效成本、敏捷創新以及強大的使用者社群。支援內部部署、雲端與混合部署。

下載 Slurm

Slurm 完全開源且不限特定硬體,為資源管理與作業排程提供完全的透明度與靈活性。部署 Slurm、為它的成長貢獻一己之力,並將它無縫整合至基礎架構堆疊。

GitHub 一探究竟,成為社群的一員!

技術

資源管理與作業排程

Slurm 的基本功能是配置資源、管理待處理工作及執行作業,但真正使其成為 HPC 與 AI 工作負載頂尖管理系統的,是 Slurm 架構中的精細設計。

GPU 資源管理

Slurm 透過頂尖的 GPU 資源管理,讓使用者得以要求 GPU 與 CPU 資源,確保作業以最高利用率快速高效執行。

雲端整合

Slurm 根據佇列深度與作業需求,利用表徵層狀態傳輸 (REST) API 以及與主要雲端供應商整合的自動擴充與混合雲端爆發技術,自動啟動雲端執行個體。

不受硬體侷限

Slurm 幾乎可執行所有 CPU 或 GPU 加速的叢集,並廣泛支援專為新式異質資料中心設計的硬體,並執行各種工作負載。

使用案例

使用 Slurm 管理工作負載

瞭解如何運用深受研究實驗室與尖端 AI 領導者信賴的開源工作負載管理器,管理運算資源。

大規模系統

同時管理數十萬個核心、數百萬個作業及多元硬體,需要的不僅僅是基本排程。 Slurm 透過階層式作業佇列、拓撲感知路由及智慧作業封裝來處理極端並行需求,最大化傳輸量。內建的電源管理、原則執行及詳細報告功能,確保大規模部署在任何規模下都能高效且可追蹤地運作。

HPC 與 AI 訓練

訓練大型 AI 模型或執行多物理模擬時,作業配置與原始運算同等重要。Slurm 的拓撲感知排程針對多層互連上的多節點工作負載進行規劃,將作業分配至網路架構中物理距離最近的節點,藉由降低通訊負擔來提升效能。 結合 GPU 感知及原則驅動的資源分配,團隊能以可預測的方式執行分散式工作負載,而無需等待優先順序較低或配置不佳的作業。

Kubernetes 叢集

Slinky 是一套元件工具組,可在 Kubernetes 環境中支援 Slurm 作業,縮小傳統 HPC 與雲端原生環境之間的落差。 團隊可在共用節點池上執行 Slurm 與 Kubernetes 工作負載,將 Kubernetes 資源要求轉化為 Slurm 作業。 因此,研究人員與開發人員能使用熟悉的 Kubernetes 工作流程,並受益於 Slurm 卓越的批次排程與資源治理。

常見問題

Slurm 常見問題

開源工作負載管理器是一款開放原始碼的軟體,可自動執行跨叢集或雲端環境等共用基礎架構的運算作業排程、執行與監控。 因為開源,所以組織可以自由使用、客製化及擴充,以滿足效能、擴充性與營運需求,而無需訂閱或企業授權。

TOP500 是全球最強大的非分散式電腦系統排名。 Slurm 是 TOP500 榜單前 100 強系統中超過半數的首選排程器,這突顯了其大規模實證的擴充性與傳輸量。

是,Slurm 提供頂尖的 GPU 資源管理,可讓使用者申請 GPU 與 CPU 資源,確保工作能快速高效地執行,同時最大化利用率。

SchedMD (現隸屬 NVIDIA) 網站提供使用者與管理員的官方快速入門指南、版本資訊以及其他詳細說明文件。 NVIDIA 另提供與 Slurm 整合與功能相關的技術部落格文章與隨選影片。1

支援要求可透過 SchedMD (現隸屬 NVIDIA) 網站的支援入口網站提交。 需具備組織網域的電子郵件地址,才能驗證支援權利。 NVIDIA 提供 Slurm 與 Slinky 的支援、訓練與諮詢服務。 透過此服務,您可直接獲得專家團隊的工程技術支援,協助您進行實作與客製化。2

Slurm 善用其對複雜網路與系統拓撲的理解,在多層互連上實現高效的工作負載配置。 這麼做可將延遲降至最低、最大化頻寬,並提升端到端作業效能,這對於 HPC 與 AI 訓練工作負載尤其重要。

SchedMD (現隸屬 NVIDIA) 開發的 Slinky 是一款開源元件工具組,讓 Slurm 在 Kubernetes 環境中運作,彌合了傳統 HPC 與雲端原生環境之間的差距。 因此團隊能在共用節點池上執行 Slurm 與 Kubernetes 工作負載,將 Kubernetes 資源要求轉化為 Slurm 作業。3

Slurm 專為大型平行作業的佇列批次排程最佳化,優先考量傳輸量與硬體效率。 Kubernetes 專為容器化微服務的宣告式、事件驅動編排而設計。4

資源

工作負載管理的最新動態

運用開源 Slurm 協調新一代 AI 工作負載

本場 GTC San Jose 2026 議程探討了 Slurm 目前的架構、近期的全新升級,以及持續進行中的社群驅動開發工作,這些努力正協助 Slurm 針對超級運算工作負載實現更高的效率、可攜性與互通性。

運用 Slurm 在 Kubernetes 上執行大規模 GPU 工作負載

大多數組織皆已在 Slurm 作業指令碼投資多年,若要轉換至 Kubernetes 卻又不維護兩套獨立環境,將面臨重大挑戰。 Slinky 是一項開源專案,提供大規模管理 Kubernetes 環境的全新方法。

從硬體到拓撲感知排程

如何將機架式硬體轉化為對終端使用者安全、高效能且易於使用的資源,是 AI 架構師與 HPC 營運商面臨的一大挑戰。NVIDIA Mission Control 這類經驗證的軟體堆疊,提供多節點排程工具,同時支援 Slurm 與 Kubernetes。

後續步驟

準備好開始了嗎?

立即從 GitHub 下載,成為社群的一員!

Slurm 支援

隨時掌握新版本最新資訊,並獲得 Slurm 工程師的直接支援。

Slurm 說明文件

取用 Slurm 的版本資訊與快速入門指南。