참고팁Reddit
Qwen 3.8 27B 최적화 모델 'Swift' 공개: 추론 속도 2배 향상
온폴리시 증류로 사고 토큰을 줄여 정확도 손실 없이 추론 속도를 2배 개선한 로컬 모델.
요약
UkisAI가 Qwen 3.8 27B 모델을 효율적으로 개선한 'Swift-Qwen3.8-27B'를 오픈소스로 공개했다. 이 모델은 On-Policy Distillation 기법을 사용하여 불필요한 사고 토큰을 줄임으로써 기존 대비 58.3%의 사고 토큰 감소와 1.95배의 속도 향상을 달성했다. 이러한 최적화 과정에서 정확도 손실은 1% 미만으로 유지하여 성능 효율성을 극대화했다. 개발진은 고사양 GPU 환경이 없는 사용자를 위해 Nvidia의 지원으로 OpenAI 호환 무료 연구용 API를 제공한다. 해당 API는 분당 5회(5RPM) 요청으로 제한되며 Hugging Face를 통해 모델을 직접 내려받아 사용할 수도 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 UkisAI Swift-Qwen3.8-27B / -58.3% thinking, x1.95 speed while keeping the accuracy of xhigh
원문 보기 ↗