GPTZero CTO가 분석한 AI 워터마크(KGW 방식) 원리와 한계
대규모 언어 모델의 텍스트 워터마크 기술적 메커니즘을 상세 분석. 모델 생성물 탐지 방식과 우회 가능성에 대한 이해를 제공함.
요약
GPTZero의 CTO Alex는 Anthropic, Google, OpenAI 등 주요 AI 기업이 사용하는 텍스트 워터마킹의 핵심 원리인 KGW 방식을 설명했다. 이 방식은 생성 시 비밀 키와 해시값을 이용해 특정 토큰의 선택 확률을 미세하게 조정(Green/Red set 분류)하고, 검출 시 해당 토큰들이 통계적으로 특정 집합에서 더 많이 등장하는지 확인하는 구조다. 문장 재구성 시 워터마크가 파손될 위험이 있으나, SIR(Statistical Interpretation of Results)이나 적응형 워터마크 기술을 통해 이를 보완할 수 있다. Google의 2만 건 이상의 테스트 결과에 따르면 이러한 워터마킹은 품질 저하가 인간에게 거의 느껴지지 않는 수준이다. 다만 짧은 텍스트나 예측 가능한 문장에서는 탐지 효율이 낮아지며, 워터마크 모델 탈취 등 보안 리스크를 방지하기 위해 스트리밍 환경에서의 토큰 단위 워터마킹 기술이 필수적으로 요구된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @alexcdot: Claude's watermark probably doesn't work how you think. As the CTO of GPTZero, I'll explain how Anthropic, Google and OpenAI are b
원문 보기 ↗