← promppy_ 실시간 AI 뉴스
참고Reddit

Qwen 3.8 27B 벤치마크: Strix Halo 환경에서 FP4 양자화로 30 tok/s 달성

특정 하드웨어 환경에서의 로컬 LLM 추론 성능 최적화 수치로, 로컬 LLM 구동 시 벤치마크 데이터로 활용하기 좋습니다.

요약

Strix Halo 노트북(Radeon 8060S, 128GB 통합 메모리) 환경에서 Qwen3.8-27B 모델의 벤치마크 테스트 결과가 공개되었다. 기존의 일반적인 측정 방식 대비 MTP(Multi-Token Prediction) 기술을 적용했을 때 성능 향상이 뚜렷하게 나타났다. llama.cpp b10503 기반의 Q8_0 설정에서는 초당 토큰 처리량(tok/s)이 기존 7.3에서 22.4로 크게 상승했다. 또한 julianmb/q38rocm FP4 포크 버전을 사용했을 때는 최대 29.9 tok/s의 속도를 기록했다. 이번 테스트는 더 정확한 측정을 위해 llama.cpp의 자체 타이밍 블록을 활용하고 클럭 및 패키지 전력을 샘플링하여 수행되었다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Qwen3.8-27B benchmarks on Strix Halo - Q8_0 MTP: 21 t/s, 3x. ROCmFP4 MTP: 26 t/s

원문 보기 ↗
다음 뉴스 →

중요DeepSeek, 8월 23일부터 주말 피크·비피크 차등 요금 폐지

주말 저비용 시간대 배치 작업 돌리던 서비스라면 비용 구조 재계산 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스