DeepSeek, 엔비디아 탈피: DeepGEMM 등 핵심 라이브러리 화웨이 Ascend 버전 오픈소스 공개
Ascend 포팅이 NVIDIA와 동일 API 유지. 중국산 칩 기반 추론 인프라가 현실화되는 신호로 주시 필요.
요약
DeepSeek이 자사 AI 모델 학습 및 추론 스택에서 NVIDIA를 배제하고 화웨이의 Ascend 칩을 지원하는 라이브러리를 오픈소스로 공개했다. 이번에 공개된 라이브러리는 DeepGEMM, DeepEP, TileLang, FlashMLA로, 그중 DeepGEMM은 모든 DeepSeek 모델의 핵심 행렬 연산 엔진이다. 해당 Ascend 포팅 버전은 NVIDIA 버전과 동일한 API를 유지하며 Ascend 950 칩에서 BF16, FP8, FP4 연산을 지원한다. 화웨이 보고서에 따르면, 오프라인 테스트에서 V4.1-Flash 모델이 카드당 초당 2,469 토큰의 출력 성능을 기록했다. 이처럼 더 빠른 커널 최적화는 칩당 처리 토큰 수를 극대화하여 오픈 소스 모델의 추론 비용 절감에 기여할 것으로 전망된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @charliejhills: 🚨Deepseek just cut NVIDIA out of its stack. Last week it open-sourced Huawei Ascend versions of the libraries it trains and serve
원문 보기 ↗