Claude의 보이지 않는 워터마크, 스테가노그래피 기술로 구현되어 변조 어려워
Claude 워터마크는 단순 메타데이터가 아닌 스테가노그래피 방식이라 텍스트 수정 없이 제거가 불가능함.
요약
X(구 트위터)의 @zelinarxy는 Anthropic의 Claude 모델에 적용될 워터마크가 단순한 메타데이터 삭제 방식이 아닌 스테가노그래피(steganography) 기술을 기반으로 할 것이라고 분석했다. 이는 단순히 메타데이터를 지우는 것만으로는 제거할 수 없으며, 워터마크를 무력화하려면 콘텐츠 내용 자체를 수정해야 함을 의미한다. 해당 기술은 매우 복원력이 높을 것으로 예상되며, 결과적으로 Claude 모델은 워터마크를 생성하는 암호화 방식에 맞춰 출력물을 조정해야 할 가능성이 있다. AI 모델의 생성물에 대한 보안 및 추적 기술이 고도화됨에 따라 향후 프롬프트 엔지니어링이나 콘텐츠 생성 시 이러한 제약 사항을 고려해야 할 것으로 보인다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @zelinarxy: the claude watermarks are gonna be steganography btw, not some kind of metadata you can strip out. you'd have to change the conten
원문 보기 ↗