Hugging Face, LLM 안전 가드레일 정책의 세분화 필요성 제기
배포 환경에 따라 위험 영역이 다름을 강조. 무조건적 차단 대신 상황별 안전 정책 설계가 필수적임.
요약
Hugging Face는 범용적 주제 전체를 차단하는 기존 LLM 안전 가드레일 방식의 한계를 지적하며, 특정 주제 내 유해한 하위 집합만 선별적으로 거부하는 기술적 접근을 제안했다. 예를 들어 동일한 정치 관련 주제라도 교육용 챗봇은 사실 관계를 설명해야 하지만, 정치적 조작을 유도하는 질문은 거부해야 하는 등 배포 환경에 따라 정교한 경계 설정이 필요하다. 기존의 LlamaGuard-3와 같은 모델은 주제 전체를 포괄하거나 특정 범주가 누락되는 등의 한계가 있어 세밀한 제어가 어렵다. Hugging Face는 최신 논문 'Safety for Whom? Boundary-Aware Self-Distillation for Controlled LLM Safety Refusal'을 통해 이 문제를 다루며, 유해한 하위 집합만을 거부하고 유익한 질문은 답변하는 '경계 인식 자기 증류(Boundary-Aware Self-Distillation)' 기법을 제시했다. 이 연구는 모델이 특정 주제 내에서 유해성과 무해성을 명확히 구분하여 거부 여부를 결정할 수 있도록 학습하고 측정하는 방법을 공식화했다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Safety for Whom? Refusing the Right Subset of a Topic, Not the Whole Topic
원문 보기 ↗