참고팁X
PQ2_0 모델, RTX 5080에서 62.11 t/s 속도 달성
RTX 5080 환경에서 로컬 LLM 추론 성능 공유. 로컬 모델 최적화 및 하드웨어 구성 시 참고.
원문 제목 @Conor_D_Dart: Just tested this model PQ2_0 on my 5080 and got 62.11 tokens a second. That's crazy fast for this GPU. Really well done @PrismML h
원문 보기 ↗