← promppy_ 실시간 AI 뉴스
참고Reddit

Ling-3.0-flash 모델, 설정 최적화로 추론 속도 2배 향상

DGX Spark 환경에서 특정 플래그 설정만으로 추론 속도를 20.8에서 38.7 tok/s로 개선하는 구체적 방법.

요약

Ling-3.0-flash INT4 모델을 DGX Spark 환경에서 실행할 때 기존 설정으로는 20.8 tok/s의 저조한 성능을 보였으나, 두 가지 설정 변경만으로 38.7 tok/s까지 처리 속도를 크게 향상시켰다. 첫 번째는 '--enforce-eager' 옵션을 제거해 CUDA graphs가 활성화되도록 하는 것이며, 두 번째는 MTP(Multi-Token Prediction) spec decode 기능을 켜는 것이다. 구체적으로는 '--speculative-config '{"method": "bailing_hybrid_v3_mtp", "num_speculative_tokens": 1}'' 설정을 적용하여 추론 속도를 높였다. 이번 최적화로 인해 기존 커뮤니티의 GGUF 방식(35.2 tok/s)보다 빠른 38.7 tok/s 성능을 달성했으며, 단일 DGX Spark 장비에서 256K 컨텍스트 윈도우 전체를 처리할 수 있게 되었다. 해당 레시피는 inclusionAI의 Ling 모델을 사용하는 실무자들에게 유용한 성능 개선 가이드를 제공한다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Two flags took the official Ling-3.0-flash INT4 from 20.8 to 38.7 tok/s on one DGX Spark

원문 보기 ↗
다음 뉴스 →

중요Anthropic, 9월 말~10월 IPO 목표 추진 (WSJ 보도)

Claude 공급사 상장은 API 가격·투자 정책 변화 신호. 장기 벤더 리스크 재점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스