Slurm은 거의 모든 워크로드를 효율적으로 관리하고 대규모 환경에서 검증된 처리량을 제공하도록 구축된 오픈소스 워크로드 관리자입니다. 컨트롤러, 노드 및 파티션으로 구성된 계층 구조를 사용하여 정책과 리소스를 기반으로 작업을 할당하여 워크로드 분산을 최적화하고, 클러스터 활용도를 극대화하며, 효율적인 작업 실행을 보장합니다. 심층적인 고성능 컴퓨팅(HPC) 및 AI 전문 지식을 갖춘 SchedMD(현재 NVIDIA의 일부)의 엔지니어가 개발 및 유지관리하는 Slurm은 TOP500의 상위 100개 시스템 중 절반 이상에서 선택되는 스케줄러입니다.
Slurm은 세계 최대 규모의 슈퍼컴퓨팅 및 AI 환경 중 많은 곳에서 신뢰하는 시장 최고의 HPC 및 AI를 위한 오픈소스 워크로드 관리자입니다.
Slurm은 일정 기간 동안 사용자에게 리소스(컴퓨팅 노드)에 대한 독점 및/또는 비독점적인 액세스를 할당하여 사용자가 작업을 수행할 수 있도록 합니다. 그런 다음 할당된 노드 집합에서 작업(일반적으로 병렬 작업)을 시작, 실행 및 모니터링하기 위한 프레임워크를 제공합니다. 마지막으로 Slurm은 보류 중인 작업 대기열을 관리하여 리소스에 대한 상충되는 요청을 중재합니다.
세계 최고의 슈퍼컴퓨터를 위한 워크로드 관리자입니다.
Slurm은 완전히 오픈소스이며 하드웨어에 구애받지 않으므로, 리소스 관리 및 작업 스케줄링을 위한 완전한 투명성과 유연성을 제공합니다. Slurm을 배포하고, 성장에 기여하며, 인프라 스택에 원활하게 통합하세요.
GitHub에서 확인하고 커뮤니티에 참여하세요!
Slurm의 기본은 리소스를 할당하고, 보류 중인 작업을 관리하며, 작업을 실행하는 것이지만, Slurm의 아키텍처의 세부 사항이 HPC 및 AI 워크로드를 위한 선도적인 관리 시스템으로 만듭니다.
연구소와 최첨단 AI 리더들이 신뢰하는 오픈소스 워크로드 관리자를 사용하여 컴퓨팅 리소스를 어떻게 관리할 수 있는지 알아보세요.
수십만 개의 코어, 수백만 개의 작업, 다양한 하드웨어를 동시에 관리하려면 기본 스케줄링 이상의 것이 필요합니다. Slurm은 계층형 작업 큐, 토폴로지 인식 라우팅, 처리량을 극대화하는 지능형 작업 팩을 통해 극도의 동시성을 처리합니다. 내장된 전력 관리, 정책 시행 및 상세한 보고는 모든 규모에서 대규모 배포를 효율적이고 책임감 있게 실행할 수 있도록 합니다.
대규모 AI 모델을 학습하거나 멀티 물리학 시뮬레이션을 실행할 때 작업 배치가 원시 컴퓨팅만큼이나 중요합니다. Slurm의 토폴로지 인식 스케줄링 기능은 네트워크 패브릭에서 물리적으로 가장 가까운 노드에 작업을 할당하여 멀티 계층 인터커넥트에서 멀티 노드 워크로드를 위한 계획을 세우고, 통신 오버헤드를 줄여 성능을 높입니다. GPU 인식 및 정책 기반 리소스 할당과 결합하여 팀은 우선순위가 낮거나 잘못 배치된 작업을 기다리지 않고도 분산된 워크로드를 예측 가능하게 실행할 수 있습니다.
Slinky는 쿠버네티스 환경에서 Slurm 운영을 가능하게 하는 구성 요소 툴킷으로, 기존 HPC와 클라우드 네이티브 환경 간의 격차를 해소합니다. 팀은 공유 노드 풀에서 Slurm 및 쿠버네티스 워크로드를 실행하여 쿠버네티스 리소스 요청을 Slurm 작업으로 전환할 수 있습니다. 이를 통해 연구원과 개발자는 Slurm의 우수한 배치 스케줄링과 리소스 거버넌스의 이점을 활용하는 동시에 친숙한 쿠버네티스 워크플로우를 사용할 수 있습니다.
FAQ
오픈 소스 워크로드 관리자는 클러스터 또는 클라우드 환경과 같은 공유 인프라 전반에 걸쳐 컴퓨팅 작업의 스케줄링, 실행 및 모니터링을 자동화하는 소프트웨어입니다. 오픈소스이기 때문에 조직은 구독이나 엔터프라이즈 라이선스 없이도 자신의 성능, 확장성 및 운영 요구 사항에 맞게 자유롭게 사용, 맞춤화 및 확장할 수 있습니다.
TOP500은 세계에서 가장 강력한 비분산형 컴퓨터 시스템의 순위입니다. Slurm은 TOP500 목록의 상위 100개 시스템의 절반 이상에서 선택되는 스케줄러이며, 이는 대규모 환경에서 검증된 확장성과 처리량을 강조합니다.
예, Slurm은 최고 수준의 GPU 리소스 관리를 제공하여 사용자가 GPU와 CPU 리소스를 모두 요청하여 활용도를 극대화하면서 작업이 빠르고 효율적으로 실행되도록 할 수 있습니다.
사용자와 관리자를 위한 공식 빠른 시작 가이드, 릴리스 노트 및 기타 상세한 문서 는 SchedMD(현재 NVIDIA의 일부) 웹사이트에서 확인할 수 있습니다. NVIDIA는 또한 Slurm 통합 및 기능과 관련된 기술 블로그 게시물과 온디맨드 영상도 제공합니다.1
SchedMD(현재 NVIDIA의 일부) 웹사이트의 지원 포털을 통해 지원 티켓을 제출할 수 있습니다. 지원 자격을 검증하려면 조직 도메인으로 된 이메일 주소가 필요합니다. Slurm 및 Slinky 지원, 교육 및 컨설팅 서비스는 NVIDIA에서 제공됩니다. 이를 통해 구현 및 맞춤화를 위해 엔지니어링 팀으로부터 직접적인 전문가 지원을 받을 수 있습니다.2
Slurm은 복잡한 네트워크 및 시스템 토폴로지에 대한 이해를 활용하여 멀티계층 인터커넥트에 효율적인 워크로드 배치를 가능하게 합니다. 이를 통해 지연 시간을 최소화하고, 대역폭을 극대화하며, 특히 HPC 및 AI 학습 워크로드에 중요한 엔드투엔드 작업 성능을 개선합니다.
SchedMD(현재 NVIDIA의 일부)는 쿠버네티스 환경에서 Slurm 운영을 가능하게 하는 오픈소스 구성 요소 툴킷으로 Slinky를 개발하여 기존 HPC와 클라우드 네이티브 환경 간의 격차를 해소했습니다. 이를 통해 팀은 공유 노드 풀에서 Slurm 및 쿠버네티스 워크로드를 실행하여 쿠버네티스 리소스 요청을 Slurm 작업으로 변환할 수 있습니다.3
Slurm은 대규모 병렬 작업의 큐 기반 배치 스케줄링에 최적화되어 처리량과 하드웨어 효율성을 우선적으로 지정합니다. 쿠버네티스는 컨테이너화된 마이크로서비스의 선언형 이벤트 기반 오케스트레이션을 위해 설계되었습니다.4