← promppy_ 실시간 AI 뉴스
참고X

NVIDIA DGX Spark 유저 주목: DeepSeek-V4-Flash 단일 유닛 구동 가능

EXL3 양자화 및 SparkInfer 최적화로 384k 컨텍스트, 47 tok/s 성능 확보. 하드웨어 리소스 효율화 사례로 참고 가치 높음.

요약

DGX Spark 사용자는 이제 단일 유닛만으로 DeepSeek v4 Flash 0731 모델을 구동할 수 있게 됐다. 이번 최적화는 EXL3 양자화와 NVFP4 KV 캐시 적용, 업스트림 프리필(prefill) 경로의 커널 버그 수정을 통해 달성했다. 이를 통해 384k 컨텍스트(최대 약 440k KV 캐시) 환경에서 초당 47 토큰의 단일 스트림 생성 속도와 초당 1024 토큰의 프리필 성능을 제공한다. 특히 370k 토큰 니들(needle) 테스트를 통과하며 높은 코드 생성 품질과 안정성을 확보했다. SparkInfer 및 DSpark 추론 가속과 결합하여 Q4_K_M 또는 Q5 GGUF 모델과 동등한 품질을 구현한다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @MiaAI_lab: A BIG moment for all DGX Spark users ⚡️ You can now run DeepSeek v4 Flash 0731 without needing a second unit, with quality high en

원문 보기 ↗
다음 뉴스 →

중요DeepSeek, 멀티모달 모델 'DeepSeek-V4-Flash-Vision-Exp' API 공개

멀티모달 에이전트 성능이 Opus-4.8에 근접. 시각+툴 결합 워크플로우 검토 가치 있음.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스