← promppy_ 실시간 AI 뉴스
참고Reddit

DGX Spark 클러스터에서 Qwen3.8-Flash-Next 성능 최적화 사례

RDMA 설정 등 대규모 로컬 LLM 구동 시 성능 극대화를 위한 구체적인 인프라/네트워크 튜닝 팁.

요약

최근 Reddit의 r/LocalLLaMA 커뮤니티에서 NVIDIA DGX Spark 2대와 Qwen3.8-Flash-Next 모델을 활용하여 181 tok/s의 총 처리량(aggregate throughput)을 달성했다는 사례가 공유되었다. 512K 컨텍스트 및 2.8M KVC 환경에서 약 9개의 에이전트 세션이 엔진을 공유하는 조건으로 해당 수치를 기록했으며, 단일 스트림 디코딩 시에는 30~50 tok/s의 성능을 보였다. 하드웨어 구성으로는 GB10 Grace Blackwell과 128GB 통합 메모리를 갖춘 DGX Spark 2대를 ConnectX-7 케이블로 직접 연결하여 NCCL over RDMA(RoCE, 200 Gb) 및 TP=2 설정을 적용했다. 작성자는 TCP 폴백(fallback) 시 성능이 절반으로 떨어질 수 있으므로 NCCL 로그를 통해 네트워크 IB 사용 여부를 반드시 검증해야 한다고 조언했다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Today I hit 181 toks/s (aggregate) on Qwen3.8-Flash-Next on 2x DGX Sparks

원문 보기 ↗
다음 뉴스 →

중요Claude Code, CLI 시작 속도 개선·토큰 사용량 가시화 등 대거 업데이트

토큰 소비 추적과 자동 모드 규칙 편집이 쉬워져, 비용 관리와 워크플로 최적화에 유리.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스