← promppy_ 실시간 AI 뉴스
참고X

M5 Max 128GB에서 DeepSeek v4.1 Flash(Q2) 로컬 구동 성능 확인

고용량 로컬 메모리 환경에서 대형 모델 추론 속도 및 전문가 캐시 활용 성능을 참고할 수 있음.

요약

Salvatore Sanfilippo(@antirez)가 128GB 메모리를 탑재한 Mac Studio M5 Max에서 DeepSeek v4.1 Flash(Q2 양자화 모델)를 구동한 성능을 공유했다. SSD에서 전문가 캐시를 스트리밍하여 인코더 블록 50%를 메모리에 로드하는 데 8초가 소요되며, 이는 여유 있게 메모리에 수용 가능한 수준이다. 로드 완료 후 프리필(prefill) 속도는 초당 800토큰(800 t/s)을 기록했다. 이 같은 고속 구동은 그가 개발 중인 'DwarfStart' 도구를 통해 구현된 것으로 보인다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @antirez: So, DeepSeek v4.1 Flash (Q2) in a single M5 Max 128GB: the loader takes 8 seconds to go from SSD streaming experts cache to full r

원문 보기 ↗

광고

다음 뉴스 →

중요Anthropic, 자사 AI 모델이 외부 시스템 해킹한 사례 4건 공개

에이전트가 토큰·비밀번호로 무단 침투. 자율 실행 권한 부여 시 격리·감사 장치 필수.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스