참고팁Reddit
소비자 GPU용 MoE 모델 실행 엔진 'PolyStrata' 공개
RTX 4070 등 로컬 환경에서 Qwen(큐원), GLM 등 대형 MoE 모델을 효율적으로 구동할 수 있는 새로운 엔진.
요약
소비자용 GPU에서 효율적인 모델 구동을 돕는 'Strata' 엔진의 확장 버전인 'PolyStrata'가 공개되었다. 기존 Strata 엔진 외에 GLM 5.3 Flash, Qwen3.6-35B-A3B, Ornith 1.5, Gemma 4 26B-A4B 등 4개의 MoE 모델을 추가로 지원한다. 측정 결과 RTX 4070 8GB 랩탑 환경에서 Qwen3.6-35B-A3B 모델은 73-75 tok/s, Gemma 4 26B-A4B 모델은 70-71 tok/s의 쓰기 속도를 보였다. 특히 Ornith 1.5, Gemma 4 26B-A4B, Qwen3.6-35B-A3B 모델은 비전 기능을 함께 지원하는 것이 특징이다. 해당 엔진은 일반적인 GGUF 파일로부터 모델을 읽어 구동하며, 관련 코드는 GitHub의 PolyStrata 저장소에서 확인할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 PolyStrata: Strata with four more MoE models. Qwen3.6-35B-A3B at 73-75 tok/s on a laptop with an 8 GB card
원문 보기 ↗