← promppy_ 실시간 AI 뉴스
참고Reddit

TensorSharp 엔진의 DeepSeek v4.1 Flash 최적화 벤치마크

Engram 룩업 최적화와 스케줄러 수정으로 8×A40 환경서 500+ tok/s prefill 성능 확보.

요약

오픈소스 LLM 추론 엔진 TensorSharp이 DeepSeek V4.1 Flash 전용 실행 경로를 추가했다. NVIDIA A40 GPU 8대를 사용한 테스트 결과, Q2_K 모델 기준 Prefill 속도는 최대 539 tok/s, 단일 스트림 Decode 속도는 약 40.7 tok/s를 기록했다. 65K 컨텍스트와 4.9K 토큰 Prefill 벤치마크 환경에서 진행된 이번 테스트에서 Engram 테이블을 GPU 상주시키자 Prefill 속도가 약 210 tok/s에서 535 tok/s로 2배 이상 개선되었다. 또한, 여러 커스텀 CUDA 백엔드를 GPU당 하나의 래퍼 백엔드로 통합하여 스케줄러 분할을 최적화함으로써 추론 효율을 높였다. Q4_K_M 모델의 경우 4개 요청 합산 시 48.9 tok/s의 성능을 보여 실무 환경에서의 활용 가능성을 확인했다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 DeepSeek V4.1 Flash on 8× A40: 500+ tok/s prefill and ~40 tok/s decode with TensorSharp

원문 보기 ↗

광고

다음 뉴스 →

중요"이번 세션 Claude 어때?" 응답이 학습 거부 설정 무시한다는 주장 확산

사내 코드로 Claude Code 쓴다면 피드백 프롬프트 응답 정책 확인 필요. 민감 데이터 유출 리스크.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스