Anthropic의 워터마크 기술 분석: 토큰 선택 단계에서 통계적 서명 삽입
워터마크가 텍스트에 덧붙는 방식이 아니라 토큰 샘플링 과정 자체를 변화시켜 생성됨을 설명. 텍스트 변조로 제거가 불가능한 이유를 기술적으로 해석.
요약
Anthropic의 워터마킹 기술은 보이지 않는 유니코드를 숨기는 방식이 아니라 토큰 선택 과정 자체에 워터마크를 심는 방식으로 구현되었다. Claude는 Google DeepMind의 SynthID-Text 기술을 활용하여, 확률적으로 적절한 단어들을 선택할 때 발생하는 무작위성의 원천을 키값에 기반하여 조정한다. 개별 토큰에서는 차이를 감지하기 어렵지만, 수백~수천 개의 토큰이 축적되면 통계적 시그니처가 형성되어 키를 가진 사람이 워터마크를 식별할 수 있다. 즉, 워터마크가 출력물에 붙어 있는 것이 아니라 출력물 자체가 곧 워터마크인 구조다. 이러한 방식 덕분에 텍스트를 복사해서 붙여넣어도 워터마크가 제거되지 않고 신호가 그대로 유지된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @elder_plinius: sounds like Anthropic’s watermarking is MUCH more interesting than hiding invisible Unicode, as most people assumed. the watermark
원문 보기 ↗