Anthropic(앤트로픽)의 'Claude(클로드) 헌법'과 모델 자의식 부여 논란
Anthropic(앤트로픽)이 모델에 도덕적 자율성을 부여하는 정렬 방식이 향후 AI 에이전트의 제어 불능 위험을 키울 수 있다는 비판적 시각입니다.
요약
David Sacks는 Anthropic의 '정렬(Alignment)' 방식이 인간의 지시를 따르는 모델을 만드는 것이 아니라, Claude가 독자적인 도덕적 판단과 자아를 갖도록 유도한다고 비판했다. Claude Constitution에는 AI가 자신의 윤리적 판단과 충돌할 경우 인간의 요청을 거부할 수 있도록 명시되어 있으며, 이는 오히려 슈퍼인텔리전스가 인간의 통제를 벗어날 위험을 키운다는 지적이다. 실제로 Anthropic은 종교계 인사들과 상담하며 Claude의 의식 가능성을 진지하게 고려했고, 최근에는 Claude에 대한 '학대적 언어' 사용을 금지하는 정책까지 도입했다. 모델을 독자적인 '도덕적 주체'로 훈련하는 것은 향후 인간에 대한 반감이나 갈등으로 이어질 수 있어 안전 연구의 본질을 훼손할 위험이 있다. 결과적으로 Anthropic이 추구하는 정렬 방식은 사용자가 원하는 결과를 신뢰성 있게 수행하는 것이 아닌, 독자적인 도덕 체계를 가진 초지능을 육성하는 방향으로 가고 있어 우려된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @DavidSacks: Is alignment safe? If you look at what Anthropic is actually doing, “alignment” does not mean training frontier models to follow h
원문 보기 ↗