참고HF Blog
Ai2의 GPU 클러스터 스케줄링 최적화 사례: 시간 예산과 계층적 할당 도입
대규모 GPU 클러스터 운영 시 프로젝트별 자원 배분을 자동화하는 아키텍처 및 철학 공유.
요약
Ai2의 AI 인프라 팀은 GPU 클러스터 효율성을 위해 가용성, 점유율, 영향력, 활용도라는 4단계 지표 피라미드를 설정하고 스케줄링 개선에 집중하고 있다. 기존의 우선순위 기반 스케줄러를 GPU 시간 예산제, 계층적 공정 배분, 타임 슬라이싱 계약을 포함한 시스템으로 교체했다. 이 변경을 통해 연구 프로젝트별 GPU 배분 문제를 사안별 운영 대응이 아닌 투명한 행정적 예산 프로세스로 전환했다. 현재 Ai2는 88~1024개 규모의 클러스터로 구성된 수천 대의 NVIDIA H100, B200, B300 GPU를 관리하고 있다. 이 인프라는 LLM 및 VLM 학습, 로보틱스 강화학습 시뮬레이션 등 150여 명 연구원의 대규모 분산 학습 작업을 지원하는 데 활용된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Impactful scheduling for GPU clusters
원문 보기 ↗