참고팁Reddit
AMD Ryzen AI 기반 DeepSeek V4 Flash 추론 최적화 성과
특정 하드웨어 환경에서 DeepSeek V4 추론 속도를 68% 이상 개선. 로컬 LLM 환경 최적화 시 참고할 만한 벤치마크 결과.
요약
AMD Ryzen AI MAX+ 395(Strix Halo)에서 DeepSeek V4 Flash와 speculative draft 모델을 구동하는 데 성공했으며, 이를 통해 실무 활용이 가능한 디코드 속도를 확보했다. 128GB 통합 메모리를 활용한 이번 구동 테스트 결과, 최대 32 tok/s의 성능을 기록했다. 이는 7월 25일 기준 LocalMaxxing에 등록된 Radeon 8060S의 기록인 18.99 tok/s 대비 68.5% 향상된 수치이다. 또한, 동일한 Ryzen AI Max 395 통합 메모리 그룹의 이전 최고 기록인 15.6 tok/s와 비교했을 때 2.05배 빠른 속도이다. 관련 상세 내용과 오픈소스 코드(Apache-2.0 라이선스)는 Lucebox 공식 블로그를 통해 공개되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 DeepSeek V4 Flash, up to 32 tok/s on AMD Ryzen AI MAX+ 395
원문 보기 ↗