Ling-3.0-flash 모델, 설정 최적화로 추론 속도 2배 향상
DGX Spark 환경에서 특정 플래그 설정만으로 추론 속도를 20.8에서 38.7 tok/s로 개선하는 구체적 방법.
요약
Ling-3.0-flash INT4 모델을 DGX Spark 환경에서 실행할 때 기존 설정으로는 20.8 tok/s의 저조한 성능을 보였으나, 두 가지 설정 변경만으로 38.7 tok/s까지 처리 속도를 크게 향상시켰다. 첫 번째는 '--enforce-eager' 옵션을 제거해 CUDA graphs가 활성화되도록 하는 것이며, 두 번째는 MTP(Multi-Token Prediction) spec decode 기능을 켜는 것이다. 구체적으로는 '--speculative-config '{"method": "bailing_hybrid_v3_mtp", "num_speculative_tokens": 1}'' 설정을 적용하여 추론 속도를 높였다. 이번 최적화로 인해 기존 커뮤니티의 GGUF 방식(35.2 tok/s)보다 빠른 38.7 tok/s 성능을 달성했으며, 단일 DGX Spark 장비에서 256K 컨텍스트 윈도우 전체를 처리할 수 있게 되었다. 해당 레시피는 inclusionAI의 Ling 모델을 사용하는 실무자들에게 유용한 성능 개선 가이드를 제공한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Two flags took the official Ling-3.0-flash INT4 from 20.8 to 38.7 tok/s on one DGX Spark
원문 보기 ↗