DeepSeek-V4 학습 효율화 프레임워크 'SLAI T-Rex' 공개
초대형 MoE 모델을 NPU 환경에서 학습 시 병목을 해결하는 연산/통신 병렬화 기법을 제시하여, 대규모 학습 인프라 최적화에 기여.
요약
SLAI T-Rex는 Ascend NPU SuperPOD 환경에서 DeepSeek-V4 시리즈의 풀 파라미터(full-parameter) 사후 학습을 최적화하는 프레임워크로, 모델 병렬화부터 커널 실행까지 계층적 최적화를 수행한다. 이 시스템은 오픈소스 베이스라인 대비 2.93배 향상된 성능인 34.22%의 MFU(Model FLOPs Utilization)를 달성하며 안정적인 학습을 지원한다. 연구팀은 이를 기반으로 복잡한 운영 연구(OR) 작업을 위한 CPT 및 SFT 워크플로우를 구축하고, 1만 개의 고품질 데이터셋을 활용해 DeepSeek-V4-Flash 기반의 전문 모델을 개발했다. 해당 모델은 제로샷 Pass@1 평가에서 71.81%의 점수를 기록하며 GPT-4o-mini 및 기본 DeepSeek-V4-Flash 모델보다 각각 3.98%p, 11.27%p 높은 성능을 보였다. 이번 연구는 Ascend 인프라를 활용한 조 단위 파라미터 모델의 효율적인 사후 학습과 도메인 특화 모델 개발을 위한 전방위적 경로를 제시했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD
원문 보기 ↗