Slurm 是一款開源工作負載管理工具,專為高效管理幾乎任何工作負載而打造,可大規模提供實證傳輸量。 它採用由控制器、節點與分區組成的層次結構,根據原則與資源分配作業、最佳化工作負載分配、最大化叢集利用率,並確保高效執行作業。 Slurm 由 SchedMD (現隸屬 NVIDIA) 具備深厚高效能運算 (HPC) 與 AI 專業知識的工程師開發及維護,是 TOP500 前 100 強系統中半數以上的首選排程器。
Slurm 是一款領先業界的 HPC 與 AI 開源工作負載管理器,受全球眾多大型超級運算與 AI 環境所信賴。
Slurm 會在一段時間內為使用者分配資源 (運算節點) 的獨家和非獨家存取權限,以便他們執行工作。 接著提供框架,用於在分配節點集上啟動、執行及監控工作 (通常為平行作業)。 最後,Slurm 透過管理待處理工作佇列來仲裁相互衝突的資源要求。
全球頂尖超級電腦的工作負載管理器。
Slurm 完全開源且不限特定硬體,為資源管理與作業排程提供完全的透明度與靈活性。部署 Slurm、為它的成長貢獻一己之力,並將它無縫整合至基礎架構堆疊。
在 GitHub 一探究竟,成為社群的一員!
Slurm 的基本功能是配置資源、管理待處理工作及執行作業,但真正使其成為 HPC 與 AI 工作負載頂尖管理系統的,是 Slurm 架構中的精細設計。
瞭解如何運用深受研究實驗室與尖端 AI 領導者信賴的開源工作負載管理器,管理運算資源。
同時管理數十萬個核心、數百萬個作業及多元硬體,需要的不僅僅是基本排程。 Slurm 透過階層式作業佇列、拓撲感知路由及智慧作業封裝來處理極端並行需求,最大化傳輸量。內建的電源管理、原則執行及詳細報告功能,確保大規模部署在任何規模下都能高效且可追蹤地運作。
訓練大型 AI 模型或執行多物理模擬時,作業配置與原始運算同等重要。Slurm 的拓撲感知排程針對多層互連上的多節點工作負載進行規劃,將作業分配至網路架構中物理距離最近的節點,藉由降低通訊負擔來提升效能。 結合 GPU 感知及原則驅動的資源分配,團隊能以可預測的方式執行分散式工作負載,而無需等待優先順序較低或配置不佳的作業。
Slinky 是一套元件工具組,可在 Kubernetes 環境中支援 Slurm 作業,縮小傳統 HPC 與雲端原生環境之間的落差。 團隊可在共用節點池上執行 Slurm 與 Kubernetes 工作負載,將 Kubernetes 資源要求轉化為 Slurm 作業。 因此,研究人員與開發人員能使用熟悉的 Kubernetes 工作流程,並受益於 Slurm 卓越的批次排程與資源治理。
常見問題
開源工作負載管理器是一款開放原始碼的軟體,可自動執行跨叢集或雲端環境等共用基礎架構的運算作業排程、執行與監控。 因為開源,所以組織可以自由使用、客製化及擴充,以滿足效能、擴充性與營運需求,而無需訂閱或企業授權。
TOP500 是全球最強大的非分散式電腦系統排名。 Slurm 是 TOP500 榜單前 100 強系統中超過半數的首選排程器,這突顯了其大規模實證的擴充性與傳輸量。
是,Slurm 提供頂尖的 GPU 資源管理,可讓使用者申請 GPU 與 CPU 資源,確保工作能快速高效地執行,同時最大化利用率。
SchedMD (現隸屬 NVIDIA) 網站提供使用者與管理員的官方快速入門指南、版本資訊以及其他詳細說明文件。 NVIDIA 另提供與 Slurm 整合與功能相關的技術部落格文章與隨選影片。1
支援要求可透過 SchedMD (現隸屬 NVIDIA) 網站的支援入口網站提交。 需具備組織網域的電子郵件地址,才能驗證支援權利。 NVIDIA 提供 Slurm 與 Slinky 的支援、訓練與諮詢服務。 透過此服務,您可直接獲得專家團隊的工程技術支援,協助您進行實作與客製化。2
Slurm 善用其對複雜網路與系統拓撲的理解,在多層互連上實現高效的工作負載配置。 這麼做可將延遲降至最低、最大化頻寬,並提升端到端作業效能,這對於 HPC 與 AI 訓練工作負載尤其重要。
SchedMD (現隸屬 NVIDIA) 開發的 Slinky 是一款開源元件工具組,讓 Slurm 在 Kubernetes 環境中運作,彌合了傳統 HPC 與雲端原生環境之間的差距。 因此團隊能在共用節點池上執行 Slurm 與 Kubernetes 工作負載,將 Kubernetes 資源要求轉化為 Slurm 作業。3
Slurm 專為大型平行作業的佇列批次排程最佳化,優先考量傳輸量與硬體效率。 Kubernetes 專為容器化微服務的宣告式、事件驅動編排而設計。4