참고팁Reddit
Qwen-3.8-27B 경량화 버전 'Qwen3.8-23B-Mini-Me' 공개
기존 모델을 레이어 가지치기(depth-pruning)하여 성능 저하를 최소화하면서 추론 속도를 높인 로컬 모델 배포판.
요약
최근 Reddit의 r/LocalLLaMA 커뮤니티에 Qwen3.8-27B 모델을 깊이 가지치기(depth pruning)하여 파라미터 수를 약 22.7B로 줄인 Qwen3.8-23B-Mini-Me 모델이 공개되었다. 별도의 미세 조정(fine-tuning) 없이 전략적인 레이어 제거만 수행했음에도, 코딩, 에이전트 작업, 다중 턴 대화 등에서 성능 저하를 최소화하며 원활하게 작동한다. 해당 모델은 기존 27B 모델보다 메모리 점유율이 낮고 추론 속도가 빨라 효율적인 운용이 가능하다. 현재 bf16, q8, q4 버전으로 배포되어 활용할 수 있다. 다만 제작자는 공식 벤치마크 테스트를 거치지 않았으므로, 실제 사용 시 프로젝트 기준에 부합하는지 직접 검증할 것을 권장한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8-23B-Mini-Me: A Depth-Pruned Qwen3.8-27B (to ~22.7BB)
원문 보기 ↗