Slurm HPC 및 AI 오케스트레이션을 위한 표준

Slurm: 오픈 소스 HPC 및 AI 워크로드 관리자

HPC 및 AI 오케스트레이션을 위한 표준입니다.

개요

오픈 소스 워크로드 관리

Slurm은 거의 모든 워크로드를 효율적으로 관리하고 대규모 환경에서 검증된 처리량을 제공하도록 구축된 오픈소스 워크로드 관리자입니다. 컨트롤러, 노드 및 파티션으로 구성된 계층 구조를 사용하여 정책과 리소스를 기반으로 작업을 할당하여 워크로드 분산을 최적화하고, 클러스터 활용도를 극대화하며, 효율적인 작업 실행을 보장합니다. 심층적인 고성능 컴퓨팅(HPC) 및 AI 전문 지식을 갖춘 SchedMD(현재 NVIDIA의 일부)의 엔지니어가 개발 및 유지관리하는 Slurm은 TOP500의 상위 100개 시스템 중 절반 이상에서 선택되는 스케줄러입니다.

Slurm에 대한 지원 받기

이제 NVIDIA에서 Slurm 및 Slinky 지원, 학습 및 컨설팅 서비스를 제공하고 있습니다. 구현부터 맞춤화에 이르기까지, 전문가로부터 엔지니어링 팀의 직접적인 도움을 받아 Slurm을 최대한 활용하세요.

쿠버네티스를 위한 Slurm

Slinky는 Slurm의 기능을 쿠버네티스로 가져오기 위한 강력한 도구 세트를 제공합니다. 사용자에게 HPC, 클라우드 네이티브 및 AI 학습 워크로드를 관리하기 위한 유연성과 사용 편의성을 제공합니다.

Slurm이란 무엇인가요?

Slurm은 세계 최대 규모의 슈퍼컴퓨팅 및 AI 환경 중 많은 곳에서 신뢰하는 시장 최고의 HPC 및 AI를 위한 오픈소스 워크로드 관리자입니다.

Slurm은 일정 기간 동안 사용자에게 리소스(컴퓨팅 노드)에 대한 독점 및/또는 비독점적인 액세스를 할당하여 사용자가 작업을 수행할 수 있도록 합니다. 그런 다음 할당된 노드 집합에서 작업(일반적으로 병렬 작업)을 시작, 실행 및 모니터링하기 위한 프레임워크를 제공합니다. 마지막으로 Slurm은 보류 중인 작업 대기열을 관리하여 리소스에 대한 상충되는 요청을 중재합니다.

주요 기능

Slurm을 자세히 알아보기

세계 최고의 슈퍼컴퓨터를 위한 워크로드 관리자입니다.

HPC 및 AI 클러스터를 위한 검증된 확장성과 처리량

선도적인 워크로드 관리자를 통해 최대 규모의 이기종 CPU 및 GPU 클러스터 전반에 걸쳐 수백만 개의 작업을 효율적으로 관리하세요. 소규모 랩부터 리더십 수준의 엑사스케일 슈퍼컴퓨터에 이르기까지 환경 전반에 걸쳐 높은 활용도와 일관된 성능을 달성하세요.

최적화된 리소스 할당

복잡한 정책 관리, 서비스 품질, 조직의 서비스 수준 계약 및 우선순위에 맞게 균형잡힌 리소스 할당을 포함한 정교한 스케줄링 및 우선순위 지정 기능을 통해 작업 실행을 가속화하고 생산성을 향상시킬 수 있습니다.

고급 토폴로지 인식 및 계획

복잡한 네트워크 및 시스템 토폴로지에 대한 Slurm의 이해를 활용하여 멀티티어 인터커넥트에 효율적인 워크로드 배치를 가능하게 하세요. 지연 시간을 최소화하고, 대역폭을 극대화하며, 엔드투엔드 작업 성능을 개선하세요.

광범위하게 액세스 가능: 온프레미스 및 클라우드 배포

투명한 코드, 능동적 개발, 효율적인 비용, 민첩한 혁신, 강력한 사용자 커뮤니티를 제공하는 오픈소스 워크로드 관리자를 통해 시간이 지남에 따라 구축 및 확장하세요. 온프레미스, 클라우드 및 하이브리드 배포를 지원합니다.

Slurm 다운로드

Slurm은 완전히 오픈소스이며 하드웨어에 구애받지 않으므로, 리소스 관리 및 작업 스케줄링을 위한 완전한 투명성과 유연성을 제공합니다. Slurm을 배포하고, 성장에 기여하며, 인프라 스택에 원활하게 통합하세요.

GitHub에서 확인하고 커뮤니티에 참여하세요!

기술

리소스 관리 및 작업 스케줄링

Slurm의 기본은 리소스를 할당하고, 보류 중인 작업을 관리하며, 작업을 실행하는 것이지만, Slurm의 아키텍처의 세부 사항이 HPC 및 AI 워크로드를 위한 선도적인 관리 시스템으로 만듭니다.

GPU 리소스 관리

최첨단 GPU 리소스 관리를 통해 Slurm은 사용자가 GPU 및 CPU 리소스를 요청할 수 있도록 하여 작업이 최대의 활용도로 빠르고 효율적으로 실행되도록 보장합니다.

클라우드 통합

Slurm은 표현 상태 전달(REST) API와 주요 클라우드 공급업체와의 통합을 통해 가능해지는 자동 확장과 하이브리드 클라우드 버스팅을 사용하여 큐 깊이와 작업 요구 사항을 기반으로 클라우드 인스턴스를 자동으로 스핀업합니다.

하드웨어 비의존성

Slurm은 다양한 워크로드를 실행하는 현대적인 이기종 데이터 센터를 위해 설계된 광범위한 하드웨어 지원을 통해 거의 모든 CPU 또는 GPU 가속 클러스터에서 실행됩니다.

사용 사례

Slurm을 통해 워크로드 관리

연구소와 최첨단 AI 리더들이 신뢰하는 오픈소스 워크로드 관리자를 사용하여 컴퓨팅 리소스를 어떻게 관리할 수 있는지 알아보세요.

대규모 시스템

수십만 개의 코어, 수백만 개의 작업, 다양한 하드웨어를 동시에 관리하려면 기본 스케줄링 이상의 것이 필요합니다. Slurm은 계층형 작업 큐, 토폴로지 인식 라우팅, 처리량을 극대화하는 지능형 작업 팩을 통해 극도의 동시성을 처리합니다. 내장된 전력 관리, 정책 시행 및 상세한 보고는 모든 규모에서 대규모 배포를 효율적이고 책임감 있게 실행할 수 있도록 합니다.

HPC 및 AI 학습

대규모 AI 모델을 학습하거나 멀티 물리학 시뮬레이션을 실행할 때 작업 배치가 원시 컴퓨팅만큼이나 중요합니다. Slurm의 토폴로지 인식 스케줄링 기능은 네트워크 패브릭에서 물리적으로 가장 가까운 노드에 작업을 할당하여 멀티 계층 인터커넥트에서 멀티 노드 워크로드를 위한 계획을 세우고, 통신 오버헤드를 줄여 성능을 높입니다. GPU 인식 및 정책 기반 리소스 할당과 결합하여 팀은 우선순위가 낮거나 잘못 배치된 작업을 기다리지 않고도 분산된 워크로드를 예측 가능하게 실행할 수 있습니다.

쿠버네티스 클러스터

Slinky는 쿠버네티스 환경에서 Slurm 운영을 가능하게 하는 구성 요소 툴킷으로, 기존 HPC와 클라우드 네이티브 환경 간의 격차를 해소합니다. 팀은 공유 노드 풀에서 Slurm 및 쿠버네티스 워크로드를 실행하여 쿠버네티스 리소스 요청을 Slurm 작업으로 전환할 수 있습니다. 이를 통해 연구원과 개발자는 Slurm의 우수한 배치 스케줄링과 리소스 거버넌스의 이점을 활용하는 동시에 친숙한 쿠버네티스 워크플로우를 사용할 수 있습니다.

FAQ

Slurm에 대한 FAQ

오픈 소스 워크로드 관리자는 클러스터 또는 클라우드 환경과 같은 공유 인프라 전반에 걸쳐 컴퓨팅 작업의 스케줄링, 실행 및 모니터링을 자동화하는 소프트웨어입니다. 오픈소스이기 때문에 조직은 구독이나 엔터프라이즈 라이선스 없이도 자신의 성능, 확장성 및 운영 요구 사항에 맞게 자유롭게 사용, 맞춤화 및 확장할 수 있습니다.

TOP500은 세계에서 가장 강력한 비분산형 컴퓨터 시스템의 순위입니다. Slurm은 TOP500 목록의 상위 100개 시스템의 절반 이상에서 선택되는 스케줄러이며, 이는 대규모 환경에서 검증된 확장성과 처리량을 강조합니다.

예, Slurm은 최고 수준의 GPU 리소스 관리를 제공하여 사용자가 GPU와 CPU 리소스를 모두 요청하여 활용도를 극대화하면서 작업이 빠르고 효율적으로 실행되도록 할 수 있습니다.

사용자와 관리자를 위한 공식 빠른 시작 가이드, 릴리스 노트 및 기타 상세한 문서 는 SchedMD(현재 NVIDIA의 일부) 웹사이트에서 확인할 수 있습니다. NVIDIA는 또한 Slurm 통합 및 기능과 관련된 기술 블로그 게시물과 온디맨드 영상도 제공합니다.1

SchedMD(현재 NVIDIA의 일부) 웹사이트의 지원 포털을 통해 지원 티켓을 제출할 수 있습니다. 지원 자격을 검증하려면 조직 도메인으로 된 이메일 주소가 필요합니다. Slurm 및 Slinky 지원, 교육 및 컨설팅 서비스는 NVIDIA에서 제공됩니다. 이를 통해 구현 및 맞춤화를 위해 엔지니어링 팀으로부터 직접적인 전문가 지원을 받을 수 있습니다.2

Slurm은 복잡한 네트워크 및 시스템 토폴로지에 대한 이해를 활용하여 멀티계층 인터커넥트에 효율적인 워크로드 배치를 가능하게 합니다. 이를 통해 지연 시간을 최소화하고, 대역폭을 극대화하며, 특히 HPC 및 AI 학습 워크로드에 중요한 엔드투엔드 작업 성능을 개선합니다.

SchedMD(현재 NVIDIA의 일부)는 쿠버네티스 환경에서 Slurm 운영을 가능하게 하는 오픈소스 구성 요소 툴킷으로 Slinky를 개발하여 기존 HPC와 클라우드 네이티브 환경 간의 격차를 해소했습니다. 이를 통해 팀은 공유 노드 풀에서 Slurm 및 쿠버네티스 워크로드를 실행하여 쿠버네티스 리소스 요청을 Slurm 작업으로 변환할 수 있습니다.3

Slurm은 대규모 병렬 작업의 큐 기반 배치 스케줄링에 최적화되어 처리량과 하드웨어 효율성을 우선적으로 지정합니다. 쿠버네티스는 컨테이너화된 마이크로서비스의 선언형 이벤트 기반 오케스트레이션을 위해 설계되었습니다.4

리소스

최신 워크로드 관리 소식

오픈 소스 Slurm을 통해 차세대 AI 워크로드를 오케스트레이트하세요

이 GTC 산호세 2026 세션은 Slurm이 슈퍼컴퓨팅 워크로드를 위한 더 높은 효율성, 휴대성, 상호 운용성을 목표로 하는 데 도움이 되는 현재 아키텍처, 최근의 향상 기능, 그리고 진행중인 커뮤니티 기반 작업을 살펴봤습니다.

Slurm을 통해 쿠버네티스에서 대규모 GPU 워크로드 실행

대부분의 조직은 Slurm 작업 스크립트에 수년간 투자해 왔으며, 두 개의 별도의 환경을 유지하지 않고 쿠버네티스로 전환하는 과제에 직면하고 있습니다. 오픈소스 프로젝트인 Slinky는 대규모 쿠버네티스 환경을 관리하는 새로운 접근 방식을 제공합니다.

하드웨어에서 토폴로지 인식 스케줄링까지

AI 아키텍트와 HPC 운영자는 랙 마운트 하드웨어를 최종 사용자가 안전하고 성능이 뛰어나며 쉽게 사용할 수 있는 리소스로 전환하는 과제에 직면하고 있습니다. NVIDIA Mission Control™ 같은 검증된 소프트웨어 스택은 멀티 노드 스케줄링을 위한 도구를 제공하여 Slurm과 쿠버네티스를 모두 지원합니다.

다음 단계

시작할 준비가 되셨나요?

GitHub에서 다운로드하고 커뮤니티에 참여하세요!

Slurm 지원

새로운 릴리스의 최신 정보를 받고 Slurm 엔지니어의 직접적인 지원을 받으세요.

Slurm 문서

Slurm을 위한 릴리스 노트와 빠른 시작 가이드에 액세스하세요.