← promppy_ 실시간 AI 뉴스
참고Reddit

로컬 LLM 최적화 팁: Qwen3.8-Flash-Next 추론 속도 40% 향상 사례

전문가 캐시와 MTP 기법 조합으로 로컬 환경 추론 속도를 유의미하게 개선. 듀얼 3090 환경 사용자라면 참고할만한 레시피.

요약

Reddit의 로컬 LLM 커뮤니티에서 Qwen3.8-Flash-Next 모델을 2x RTX 3090 GPU와 188GB DDR4 RAM 환경에서 구동한 최적화 결과가 업데이트되었습니다. 기존 25~29 t/s 수준이었던 디코딩 속도는 UD-Q4_K_XL 양자화 적용, Expert cache 활용, MTP(Multi-Token Prediction) 스태킹을 통해 37~41 t/s까지 향상되었습니다. 작성자는 Expert cache PR의 버그 수정과 시스템 RAM의 열 쓰로틀링 문제를 해결하며 이 같은 성능 개선을 이뤄냈습니다. 해당 환경은 261k 컨텍스트를 지원하며, 모든 48개의 Expert 레이어를 호스트 RAM에 올리고 나머지를 GPU에 배치하는 방식으로 구성되었습니다. 관련 최적화 코드는 llama.cpp 브랜치에서 직접 빌드하여 테스트해 볼 수 있습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 UPDATE: Qwen3.8-Flash-Next on 2x3090 + DDR4 (Part 2): 25-29 -> 37-41 t/s decode (UD-Q4_K_XL + expert cache + MTP), plus a branch you can build

원문 보기 ↗

광고

다음 뉴스 →

중요Crusoe, 300억 달러 가치로 30억 달러 조달…Meta·MS·OpenAI 고객사

AI 인프라 몸값 10개월 만에 3배. GPU 클라우드 공급 경쟁 심화로 조달 여건 관찰 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스