← promppy_ 실시간 AI 뉴스
참고Reddit

Qwen3.8-27B 최적화: RTX 3090에서 138 tps 성능 달성

로컬 LLM 추론 엔진 최적화 사례. fp8 KV 캐시와 MTP-4 드래프트 기법으로 기존 대비 추론 속도 및 지연 시간 획기적 개선.

요약

Reddit의 r/LocalLLaMA 커뮤니티에서 RTX 3090 환경을 최적화한 Qwen3.8-27B 추론 엔진인 Dflash2의 성능 업데이트가 공유되었다. 250W로 전력 제한된 RTX 3090에서 Dflash2를 구동한 결과, 싱글 유저 기준 초당 토큰 처리량(tps)이 138까지 향상되었으며 64 동시 접속 시 942 tps를 기록했다. 특히 긴 대화에서의 후속 턴 처리 시간이 기존 약 23초에서 약 1초 수준으로 획기적으로 단축되었다. 이 모델은 fp8 KV 캐시, int8 활성화 함수, MTP-4 드래프트, 262k 컨텍스트를 지원하는 KVarN 기술 등을 적용해 효율성을 극대화했다. 개발자는 3일 전 82 tps로 시작했던 성능을 지속적인 최적화를 통해 빠르게 개선해나가고 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 I pushed Qwen3.8-27B limits again... Dflash2 - 134 tps on a RTX 3090

원문 보기 ↗
다음 뉴스 →

중요바이낸스, AI 에이전트 자율 거래 플랫폼 'Agent OS' 출시…MCP·Cursor·Claude Code 연동

에이전트가 실제 자금을 굴리는 시대. MCP·API 연동으로 거래봇 구축 가능하나 통제 책임은 사용자 몫.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스