중요AI타임스
엔비디아, LLM 배포 가속 '모델익스프레스' 공개…서버 대기 8분→1분대 단축
TB급 모델 가중치 로딩 병목 해소. RL 사후학습·대규모 서빙 인프라 운영 시 도입 검토 가치.
요약
엔비디아가 테라바이트급 LLM 배포 시 발생하는 가중치 이동 병목 현상을 해결하기 위해 새로운 소프트웨어 인프라 '모델익스프레스(ModelExPress)'를 24일(현지시간) 발표했다. 이 기술은 GPU 간 직접 전송 기능을 활용하여 서버 부팅 시 모델 가중치를 로드하는 시간을 기존 8분대에서 1분대 미만으로 획기적으로 단축한다. 모델익스프레스는 LLM의 배포와 확장뿐만 아니라 강화학습(RL) 사후학습 과정에서의 효율성을 최적화하는 데 중점을 둔다. 대규모 AI 모델 운용 시 서버 확장 및 복구 과정의 지연 시간을 줄여 전체적인 인프라 운영 효율을 높일 수 있을 것으로 기대된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 엔비디아, LLM 배포 가속 '모델익스프레스' 발표..."서버 대기 8분에서 1분대로 단축"
원문 보기 ↗