← promppy_ 실시간 AI 뉴스
참고X

DeepSeek v4.1 Flash 로컬 구동 최적화: 2x DGX Sparks 환경 설정 가이드

로컬 인프라에서 DeepSeek v4.1 Flash 최적 성능(컨텍스트/KV 캐시)을 끌어내는 엔지니어링 설정 공유.

요약

DeepSeek v4.1 Flash 모델을 2개의 DGX Sparks 시스템에서 구동할 수 있게 되었다. 이번 설정은 안정성을 위해 600k 컨텍스트와 775k KV 캐시 풀을 제공하며 2개의 동시 연결을 지원한다. 성능 테스트 결과 단일 스트림에서는 약 32 tok/s, 2개의 동시 스트림에서는 약 42 tok/s의 속도를 기록했다. 프리필(prefill) 속도는 8k-128k 범위에서 약 1000 tok/s, 256k에서 약 872 tok/s로 측정되었다. 해당 모델은 550k 프리필 스트레스 테스트를 통과했으며 EXL3 양자화 방식을 사용한다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @MiaAI_lab: Run DeepSeek v4.1 Flash on 2x DGX Sparks ✨ One of the BEST models you can run today, now available for only two dgx sparks. Ships

원문 보기 ↗

광고

다음 뉴스 →

중요찰스 3세 국왕, NVIDIA·Google·OpenAI·Anthropic 리더 스코틀랜드 소집... AI 개발 속도 조절 논의

AI 규제·거버넌스 논의 본격화 신호. 글로벌 정책 방향이 서비스 로드맵에 미칠 영향 주시 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스