Qwen3.8-27B 템플릿의 숨겨진 'xhigh' 추론 설정 확인 및 비용 측정 결과
채팅 템플릿상 추론 설정이 기본값으로 과도하게 잡혀있을 수 있음. 로컬 모델 운용 시 템플릿 변수를 확인해 비용을 최적화할 것.
요약
Qwen3.8-27B 모델은 소비자용 하드웨어에서 구동 가능한 코딩 성능 최상위 모델 중 하나로 평가받으며, 기본 설정으로 'xhigh' 단계의 reasoning_effort를 사용합니다. 실측 결과 'xhigh' 설정은 'low'나 'medium'보다 현저히 많은 토큰(36,188개)과 긴 처리 시간(869초)을 소요하는 것으로 확인되었습니다. 흥미롭게도 'low'와 'medium' 설정은 실제 성능에서 유의미한 차이가 없었습니다. 이 reasoning_effort 설정은 서버 옵션이 아닌 챗 템플릿 변수이기 때문에 백엔드에서 별도로 보고되지 않는다는 점에 유의해야 합니다. 따라서 사용자는 자신의 워크로드에 맞는 효율적인 설정을 위해 템플릿을 직접 조정할 필요가 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8-27B has the best coding ceiling you can run at home on consumer hardware, it ships with reasoning_effort defaulting to xhigh - I measured what that costs
원문 보기 ↗