참고팁Reddit
DeepSeek-V4-Flash-0731, 3xMI50 환경에서 초당 15토큰 구동 성공
MI50 GPU 환경의 로컬 추론 성능 데이터. 고성능 GPU 클러스터 없는 환경에서의 모델 구동 실전 예시.
요약
한 레딧 사용자가 3개의 AMD MI50 32GB GPU 환경에서 'DS V4-Flash-0731' 모델을 로컬로 구동하는 데 성공했다. 해당 모델은 90.9GB 용량으로 96GB VRAM에 완전히 로드되어 안정적으로 실행된다. llama-server 구동 시 텍스트 생성 속도는 초당 약 15~16 토큰을 유지했으며, 3만 토큰 규모의 긴 응답 처리 시에도 성능 저하가 발생하지 않았다. 프롬프트 처리 속도는 초당 약 105~110 토큰 수준으로 측정되었다. 모델이 MI50의 메모리 대역폭과 PCIe 4.0 대역폭을 혼동하는 등의 사소한 오류는 있었으나, 전반적인 대화 성능은 양호한 것으로 평가된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Ran DS V4-Flash-0731 Locally on 3xMI50 32GB @ ~15 t/s TG
원문 보기 ↗