참고Reddit
Qwen-3.8-27B 성능 분석: 이전 버전 대비 지식 기반 팩트 회상 능력 저하 관찰
최신 모델이 항상 우위는 아님을 시사. 특정 팩트 기반 태스크에서 이전 버전(3.6) 대비 성능이 하락했다는 커뮤니티의 구체적 검증 결과.
요약
최근 Reddit의 LocalLLaMA 커뮤니티에서 Qwen3.8-27B 모델이 이전 버전인 Qwen3.6 대비 지식 회상 능력에서 퇴보를 보였다는 사용자들의 평가가 제기되었다. 다양한 양자화 수준과 샘플링 설정으로 테스트한 결과, Qwen3.8-27B는 Qwen3.6이 정확하게 답변하던 특정 틈새 상식 및 정보성 질문들을 제대로 처리하지 못하는 것으로 나타났다. 실제 오프라인 지식 벤치마크에서도 Qwen3.8-27B는 이전 모델보다 무작위 사실을 회상하는 능력이 현저히 낮거나 환각 현상이 더 빈번하게 발생하는 경향을 보였다. 실무자들은 해당 모델이 특정 작업에서 우수한 성능을 보이기도 하지만, 지식 기반의 질의응답 작업에서는 성능 저하가 있음을 인지하고 활용할 필요가 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Qwen3.8-27B took a serious hit to *knowledge* vs 3.6
원문 보기 ↗