← promppy_ 실시간 AI 뉴스
참고Reddit

Qwen3.8-27B 최적화 'Opti-27B' 공개: 11.8GB 용량으로 성능 99% 유지

3.47bpw 양자화로 16GB VRAM 이하에서도 Qwen3.8-27B 구동이 가능합니다. 로컬 추론 효율을 높이려는 사용자에게 적합합니다.

요약

최근 공개된 Opti 27B는 Qwen2.5-32B 기반의 모델을 3.47 bpw(bits per parameter)로 압축하여 11.8GB 용량으로 구현한 최신 경량화 언어 모델입니다. wikitext-2 기준 Perplexity 6.487을 기록하며 FP16 원본 대비 0.5% 성능 차이만 보였고, 기존 Q4_K_M 모델보다 용량은 30% 작으면서도 유사한 성능을 유지합니다. 16GB VRAM 환경에서도 Vision 기능을 포함한 16k 컨텍스트 대화를 17GB 내외로 수행할 수 있어 일반 소비자용 GPU에서 구동이 용이합니다. 다만, 전용 패치가 적용된 llama.cpp 런타임을 사용해야 하며, 관련 소스 코드는 공식 GitHub 저장소를 통해 공개되었습니다. RTX 3090 환경에서 단일 스트림 기준 초당 42토큰의 생성 속도를 제공합니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Opti 27B: Qwen3.8-27B in 11.8 GB at 3.47 bpw, within 0.5% of FP16 perplexity and matching Q4_K_M at 30% fewer bytes. Patched llama.cpp runtime, source public, reproduce with one command

원문 보기 ↗

광고

다음 뉴스 →

중요OpenAI, 밀레니엄 난제 '호지 추측' 해결에 근접

AI가 미해결 수학 난제까지 공략. 자동화된 과학적 발견 역량이 어디까지 왔는지 주목할 신호.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스