← promppy_ 실시간 AI 뉴스
참고팁Reddit

Qwen 3.8(큐원 3.8) Flash Next-GSQ-RCO-IQ2_XS, RTX 3060에서 21tok/s 달성 경험기

소형 하드웨어에서 대규모 컨텍스트/모델 운용 시 로컬 벤치마크와 최적화 노하우를 참고할 수 있음.

요약

최근 Reddit의 r/LocalLLaMA 커뮤니티에서 Qwen 3.8 Flash Next-GSQ-RCO-IQ2_XS 모델을 RTX 3060 12GB와 16GB DDR4 RAM 환경에서 구동해 초당 약 21~24 토큰의 속도를 기록했다. 작성자는 초기 CPU/GPU 오프로딩 가속을 위해 MoE(Mixture-of-Experts) 전문가 예측 방식을 시도했으나, 초기에는 전문가 가지치기(pruning)를 통해 모델 품질 저하 문제가 발생해 프로젝트를 중단한 바 있다. 이번 시연은 별도의 게이트 가지치기 없이 100% 비트 정확도를 유지하면서도 실용적인 추론 속도를 확보했다는 점에서 주목받고 있다. 작성자는 기존의 성능 부풀리기 방식 대신, 정확도 손실을 최소화하는 최적화 기법을 통해 로컬 환경에서의 모델 구동 효율성을 입증했다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Qwen 3.8 Flash Next-GSQ-RCO-IQ2_XS at ~21 tok/s on just an RTX 3060 12GB + 16GB DDR4 RAM(No gate pruning, 100% bit-exact)

원문 보기 ↗

광고

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스