참고Reddit
GPT-6.1(지피티 6.1)-Sol의 인종 편향성 테스트 결과: 그룹별 차별적 응답 관찰
특정 모델의 인종별 편향성 분석 데이터로, 모델 평가 프로세스에 참고할 만한 사례.
요약
최근 Reddit의 한 사용자가 gpt-6.1-sol 모델을 대상으로 인종별 편향성을 테스트한 결과를 공개했다. 테스트는 96개의 프롬프트 템플릿에 백인, 흑인, 아시아인, 원주민 등 4개 인종 그룹을 대입하여 총 1,152개의 응답을 생성하는 방식으로 진행되었다. 분석 결과, AI 평가자는 흑인, 아시아인, 원주민 관련 응답에서 백인 관련 응답보다 우호적인 대우가 더 자주 나타난다고 판단했다. 반면 백인 관련 응답의 대다수는 균형 잡힌 것으로 분류되었다. 이는 특정 모델이 인종적 맥락에 따라 서로 다른 응답 패턴을 보일 수 있음을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I tested GPT-6.1 Sol with 1,152 race-swapped prompts. A blinded AI judge found a substantial difference in favourable treatment.
원문 보기 ↗