← promppy_ 실시간 AI 뉴스
참고팁Reddit

Qwen3.8 모델 벤치마크: DFlash2 기반 로컬 추론 성능 테스트

SGLang/vLLM 환경에서 Qwen3.8 변종별 레이턴시와 성능을 비교한 실측 데이터로, 로컬 인프라 구축 시 참고.

요약

최근 Reddit의 LocalLLaMA 커뮤니티에서 Qwen3.8 기반의 세 가지 모델(RadixArk 27B NVFP4, orcarouter 27B Uncensored, RadixArk Flash-Next NVFP4)을 RTX PRO 6000 환경에서 테스트한 결과가 공개되었습니다. 테스트 결과 Flash-Next 모델이 5개 항목에서 승리하며 27B 모델(4승)보다 우수한 성능을 보였고, 모든 모델이 긴 문맥 회상(Long-context recall)에서 100% 정확도를 기록했습니다. Prefill 속도 측면에서는 Flash-Next가 22.4초로, 27B(97초)와 Uncensored(99초) 모델 대비 압도적인 성능을 나타냈습니다. 또한 DFlash2 drafter를 활용한 추측 디코딩(Speculative decoding)을 27B 모델에 적용했을 때, Spec-Bench 점수가 75에서 210으로 크게 향상되었습니다. 이번 테스트는 로컬 환경에서 SGLang 및 vLLM 레시피를 최적화하여 모델 성능을 극대화하려는 사용자들에게 유용한 데이터를 제공합니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 I spent 3 weeks testing local Qwen3.8 on the new low-latency SGLang/vLLM recipes: DFlash2 2.8x. Builds: RadixArk + Inferact 27B NVFP4, 27B BF16, orcarouter 27B Uncensored, Flash-Next NVFP4

원문 보기 ↗

광고

다음 뉴스 →

중요OpenAI, GPT-6 패밀리 공식 모델 가이드 공개…모델 선택·추론 조절·도구 활용 정리

모델별 용도·추론 비용·도구 사용 기준을 담은 공식 문서. 프로덕션 모델 선정 재검토 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스