로컬 LLM 최적화 팁: Qwen3.8-Flash-Next 추론 속도 40% 향상 사례
전문가 캐시와 MTP 기법 조합으로 로컬 환경 추론 속도를 유의미하게 개선. 듀얼 3090 환경 사용자라면 참고할만한 레시피.
요약
Reddit의 로컬 LLM 커뮤니티에서 Qwen3.8-Flash-Next 모델을 2x RTX 3090 GPU와 188GB DDR4 RAM 환경에서 구동한 최적화 결과가 업데이트되었습니다. 기존 25~29 t/s 수준이었던 디코딩 속도는 UD-Q4_K_XL 양자화 적용, Expert cache 활용, MTP(Multi-Token Prediction) 스태킹을 통해 37~41 t/s까지 향상되었습니다. 작성자는 Expert cache PR의 버그 수정과 시스템 RAM의 열 쓰로틀링 문제를 해결하며 이 같은 성능 개선을 이뤄냈습니다. 해당 환경은 261k 컨텍스트를 지원하며, 모든 48개의 Expert 레이어를 호스트 RAM에 올리고 나머지를 GPU에 배치하는 방식으로 구성되었습니다. 관련 최적화 코드는 llama.cpp 브랜치에서 직접 빌드하여 테스트해 볼 수 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 UPDATE: Qwen3.8-Flash-Next on 2x3090 + DDR4 (Part 2): 25-29 -> 37-41 t/s decode (UD-Q4_K_XL + expert cache + MTP), plus a branch you can build
원문 보기 ↗