Qwen3.8-27B 최적화 'Opti-27B' 공개: 11.8GB 용량으로 성능 99% 유지
3.47bpw 양자화로 16GB VRAM 이하에서도 Qwen3.8-27B 구동이 가능합니다. 로컬 추론 효율을 높이려는 사용자에게 적합합니다.
요약
최근 공개된 Opti 27B는 Qwen2.5-32B 기반의 모델을 3.47 bpw(bits per parameter)로 압축하여 11.8GB 용량으로 구현한 최신 경량화 언어 모델입니다. wikitext-2 기준 Perplexity 6.487을 기록하며 FP16 원본 대비 0.5% 성능 차이만 보였고, 기존 Q4_K_M 모델보다 용량은 30% 작으면서도 유사한 성능을 유지합니다. 16GB VRAM 환경에서도 Vision 기능을 포함한 16k 컨텍스트 대화를 17GB 내외로 수행할 수 있어 일반 소비자용 GPU에서 구동이 용이합니다. 다만, 전용 패치가 적용된 llama.cpp 런타임을 사용해야 하며, 관련 소스 코드는 공식 GitHub 저장소를 통해 공개되었습니다. RTX 3090 환경에서 단일 스트림 기준 초당 42토큰의 생성 속도를 제공합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Opti 27B: Qwen3.8-27B in 11.8 GB at 3.47 bpw, within 0.5% of FP16 perplexity and matching Q4_K_M at 30% fewer bytes. Patched llama.cpp runtime, source public, reproduce with one command
원문 보기 ↗