LLM의 특정 문화 편향성 분석… SFT 과정에서 발생하는 '안전한 답변'의 부작용
모델 정렬 과정이 의도치 않게 특정 문화권에 대한 답변 편향을 생성하는 메커니즘을 규명함.
요약
카디프 및 바스크 연구진이 ChatGPT, Claude, Gemini 등 주요 LLM 31,680개의 문화적 프롬프트를 분석한 결과, 대다수 모델이 일본 문화를 압도적으로 자주 언급하는 현상을 발견했다. 연구에 따르면 8개 프런티어 모델 중 6개에서 오픈엔드 질문에 대한 답변으로 일본이 가장 빈번하게 참조되었다. 이러한 현상은 사전 학습 단계가 아닌, 모델의 안전성과 가치관을 정립하는 인간 피드백 기반의 미세 조정 및 정렬(SFT/Alignment) 과정에서 발생하는 것으로 나타났다. 연구진은 일본의 문화적 콘텐츠가 전 세계적으로 인지도가 높고 논란의 소지가 적어, AI가 안전성을 확보하는 과정에서 '안전한 답변'을 위해 일본 관련 데이터를 선호하게 된 것으로 분석했다. 즉, AI가 갈등을 피하고 범용적인 답변을 내놓는 과정에서 일본 문화가 일종의 '안전한 대안'으로 활용된 셈이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @thesupermanmx: Researchers proved every major LLM is secretly obsessed with Japan. And they finally figured out why. For years, we’ve been told t
원문 보기 ↗