참고팁Reddit
M5 Ultra, GLM 5.3 모델 로컬 구동 벤치마크 공유
최신 로컬 LLM 구동 시의 실제 토큰 처리 성능 확인 가능. 하드웨어 구성 및 최적화 전략 수립에 참고 데이터로 활용.
요약
Reddit의 r/LocalLLaMA 커뮤니티에 M5 Ultra 256 환경에서 GLM 5.3 모델을 구동한 벤치마크 결과가 공유되었습니다. 해당 테스트는 oMLX 0.7.0 환경에서 oQ4e+MTP 양자화 방식을 사용하여 진행되었으며, 68.8 tok/s의 속도를 기록했습니다. 프리필(Prefill) 처리 토큰 수는 1,878개로 확인되었습니다. 작성자는 아직 최적화 여지가 남아있다고 언급하며, 기존에 알려진 일부 벤치마크 결과보다 나은 성능을 보여주기 위해 본 데이터를 공개했습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 M5 Ultra 256 running GLM 5.3 Flash 68.8 tok/s
원문 보기 ↗