언센서드(Uncensored) 모델의 답변 편향성 분석: 모델 기질에 따른 결과 차이
모델의 검열 제거가 단순히 거부 메시지만 없애는 게 아니라 답변의 자신감과 낙관성에 영향을 줄 수 있음을 시사.
요약
최근 Reddit의 r/LocalLLaMA 커뮤니티에서 언센서드(Uncensored) LLM이 베이스 모델보다 측정 가능한 수준으로 더 낙관적인 답변을 내놓는다는 분석이 제기되었다. 테스트 결과 언센서드 모델은 거부 반응을 제거했을 뿐만 아니라, 주식 시장 예측 등에서 '상승할 것'이라는 단정을 더 많이 사용하며 불확실성을 나타내는 표현을 줄이는 등 더 자신감 있는 추론을 보였다. 하지만 이러한 태도 변화가 실제 예측 정확도 향상으로 이어지지는 않았으며, 기존 베이스 모델과 동일한 수준의 무작위 적중률을 기록했다. 즉, 언센서드 모델은 답변의 '정확성'이 아닌 '확신'의 정도를 높이는 경향을 보였다. 또한 모델 아키텍처에 따라 결과가 다르게 나타났는데, Gemma 모델에서는 오히려 자신감이 감소하고 Qwen 모델에서는 자신감이 상승하는 현상이 관찰되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 "Uncensored" LLMs are measurably more optimistic than their base models
원문 보기 ↗