DeepSeek, 연산 효율 극대화하는 추론 엔진 'DeepGEMM' 오픈소스 공개
GPU 활용 효율을 높여 토큰 처리 속도 향상 및 비용 절감 가능. 로컬 모델 최적화나 인프라 비용 절감 고민 시 검토 필요.
요약
중국 AI 스타트업 DeepSeek이 자사 모델 훈련 및 추론에 사용하는 엔진인 DeepGEMM 라이브러리를 공개했다. 이 엔진은 GPU 연산 효율을 극대화하여 기존 대비 토큰당 비용을 최대 98%까지 절감할 수 있는 것으로 알려졌다. DeepGEMM을 자체 모델에 적용하면 동일한 GPU 자원 내에서 초당 더 많은 토큰을 처리할 수 있으며, 이는 전문가가 튜닝한 기존 GPU 라이브러리보다 빠르거나 대등한 성능을 제공한다. 결과적으로 고가의 API 사용 비용을 획기적으로 낮출 수 있어 GPU 인프라 효율성을 극대화하려는 실무자에게 유용한 도구가 될 전망이다. 현재 해당 기술은 공개 저장소를 통해 누구나 접근하여 활용할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @Mnilax: China f*cked the world again DeepSeek just dropped a killer library that saves up to 98% on tokens ur GPT Astra and Opus 5.5 it's
원문 보기 ↗