참고팁Reddit
GLM-5.3-Flash 로컬 가속: Project Maya로 추론 속도 3배 개선
321B 모델을 단일 GPU에서도 30 tok/s의 실용적인 속도로 구동하게 해주는 최적화 엔진 활용 사례.
요약
Project Maya는 3,210억 개의 매개변수를 가진 GLM-5.3-Flash 모델을 개인이 보유한 GPU 환경에서 구동할 수 있도록 지원한다. 이 프로젝트는 모델의 활성 매개변수를 토큰당 약 180억 개 수준으로 최적화하여 일반적인 단일 NVIDIA GPU 환경에서도 구동 가능하게 설계되었다. 실제로 사용자 테스트 결과, 기존 10tok/s 수준이었던 GLM-5.3-Flash의 추론 속도가 Maya를 통해 30tok/s까지 개선된 것으로 나타났다. 또한, 해당 모델은 최대 100만 토큰의 컨텍스트를 지원하며, OpenAI 및 Anthropic 호환 API와 이미지 생성 기능을 제공한다. 현재 AMD 및 Windows 환경에서도 실험적인 지원을 시작했으며, MIT 라이선스를 기반으로 운영된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 "Strata" for GLM5.3 Flash is here for some! Project Maya
원문 보기 ↗