참고X
DeepSeek, 신규 모델 'V4.1-Flash-2-Sparks' 공개
262k 컨텍스트와 2000 tok/s 처리 성능을 갖춘 최신 모델, 경량화 추론 수요에 참고.
요약
Deepseek-V4.1-Flash-2-Sparks 모델이 새롭게 공개되었습니다. 이번 모델은 최적화에 약 한 달의 기간이 소요되었으며, 2000 tok/s의 prefill 성능과 29 tok/s(prose), 41 tok/s(code)의 decode 속도를 지원합니다. 262k의 컨텍스트 윈도우와 2백만 개의 kV 캐시 풀을 제공하며, 8개의 동시성 처리가 가능합니다. 또한 Vision 기능을 포함하고 있으며, 92%의 top 토큰 일치도와 0.07의 KLD(Kullback-Leibler Divergence) 수치를 보입니다. 해당 모델은 pi를 통해 로드하여 사용할 수 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @0xSero: Deepseek-V4.1-Flash-2-Sparks is out! It took nearly a month to get this done right - 2000 tok/s prefill - 29 tok/s decode prose -
원문 보기 ↗