참고팁Reddit
Qwen 3.8(큐원 3.8) Flash Next-GSQ-RCO-IQ2_XS, RTX 3060에서 21tok/s 달성 경험기
소형 하드웨어에서 대규모 컨텍스트/모델 운용 시 로컬 벤치마크와 최적화 노하우를 참고할 수 있음.
요약
최근 Reddit의 r/LocalLLaMA 커뮤니티에서 Qwen 3.8 Flash Next-GSQ-RCO-IQ2_XS 모델을 RTX 3060 12GB와 16GB DDR4 RAM 환경에서 구동해 초당 약 21~24 토큰의 속도를 기록했다. 작성자는 초기 CPU/GPU 오프로딩 가속을 위해 MoE(Mixture-of-Experts) 전문가 예측 방식을 시도했으나, 초기에는 전문가 가지치기(pruning)를 통해 모델 품질 저하 문제가 발생해 프로젝트를 중단한 바 있다. 이번 시연은 별도의 게이트 가지치기 없이 100% 비트 정확도를 유지하면서도 실용적인 추론 속도를 확보했다는 점에서 주목받고 있다. 작성자는 기존의 성능 부풀리기 방식 대신, 정확도 손실을 최소화하는 최적화 기법을 통해 로컬 환경에서의 모델 구동 효율성을 입증했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen 3.8 Flash Next-GSQ-RCO-IQ2_XS at ~21 tok/s on just an RTX 3060 12GB + 16GB DDR4 RAM(No gate pruning, 100% bit-exact)
원문 보기 ↗