TensorSharp 엔진의 DeepSeek v4.1 Flash 최적화 벤치마크
Engram 룩업 최적화와 스케줄러 수정으로 8×A40 환경서 500+ tok/s prefill 성능 확보.
요약
오픈소스 LLM 추론 엔진 TensorSharp이 DeepSeek V4.1 Flash 전용 실행 경로를 추가했다. NVIDIA A40 GPU 8대를 사용한 테스트 결과, Q2_K 모델 기준 Prefill 속도는 최대 539 tok/s, 단일 스트림 Decode 속도는 약 40.7 tok/s를 기록했다. 65K 컨텍스트와 4.9K 토큰 Prefill 벤치마크 환경에서 진행된 이번 테스트에서 Engram 테이블을 GPU 상주시키자 Prefill 속도가 약 210 tok/s에서 535 tok/s로 2배 이상 개선되었다. 또한, 여러 커스텀 CUDA 백엔드를 GPU당 하나의 래퍼 백엔드로 통합하여 스케줄러 분할을 최적화함으로써 추론 효율을 높였다. Q4_K_M 모델의 경우 4개 요청 합산 시 48.9 tok/s의 성능을 보여 실무 환경에서의 활용 가능성을 확인했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 DeepSeek V4.1 Flash on 8× A40: 500+ tok/s prefill and ~40 tok/s decode with TensorSharp
원문 보기 ↗