참고팁X
M5 Max 128GB에서 DeepSeek v4.1 Flash(Q2) 로컬 구동 성능 확인
고용량 로컬 메모리 환경에서 대형 모델 추론 속도 및 전문가 캐시 활용 성능을 참고할 수 있음.
요약
Salvatore Sanfilippo(@antirez)가 128GB 메모리를 탑재한 Mac Studio M5 Max에서 DeepSeek v4.1 Flash(Q2 양자화 모델)를 구동한 성능을 공유했다. SSD에서 전문가 캐시를 스트리밍하여 인코더 블록 50%를 메모리에 로드하는 데 8초가 소요되며, 이는 여유 있게 메모리에 수용 가능한 수준이다. 로드 완료 후 프리필(prefill) 속도는 초당 800토큰(800 t/s)을 기록했다. 이 같은 고속 구동은 그가 개발 중인 'DwarfStart' 도구를 통해 구현된 것으로 보인다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @antirez: So, DeepSeek v4.1 Flash (Q2) in a single M5 Max 128GB: the loader takes 8 seconds to go from SSD streaming experts cache to full r
원문 보기 ↗