Qwen 3.8 27B 파생 모델 8종 성능 비교 벤치마크
Abliterated 모델들의 실질적 성능과 검열 해제 여부 검증. 특정 모델 선택 시 벤치마크 참고.
요약
최근 Reddit r/LocalLLaMA 커뮤니티에서 Qwen 3.8 27B 모델의 8가지 무검열(uncensored) 변형 버전을 비교한 상세 분석 결과가 공개되었습니다. 이번 테스트는 약 11일간 진행되었으며, 총 167시간의 GPU 연산 자원을 투입하여 가중치 비교, KL 발산 측정, 13개 벤치마크 평가, HarmBench 400을 통한 거절률 측정 등이 수행되었습니다. Qwen 3.8 27B가 사고형 모델인 만큼 추론 시 더 높은 토큰 예산을 설정하여 정밀도를 높였습니다. 연구팀은 Hugging Face에 공개된 다양한 'abliterated' 모델들이 실제로 주장하는 성능을 내는지 검증하는 데 초점을 맞췄습니다. 자세한 모델별 랭킹과 HarmBench ASR(공격 성공률) 데이터는 abliterlitics.dev에서 확인할 수 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 8 uncensored Qwen 3.8 27B variants, one base, 167 GPU hours - Abliterlitics
원문 보기 ↗