LLM 워터마크 회피 기법 연구: 단순 편집은 무의미, 특정 토큰 삽입이 유효
LLM 생성 텍스트의 워터마크 탐지 로직에 대한 실증적 분석. 단순 수정보다 특정 토큰 삽입이 탐지 우회에 효과적임을 입증한 기술적 분석글.
요약
최근 한 개발자가 Claude의 텍스트 워터마크를 문장 재구성 없이 제거하는 우회 방법을 실험한 결과를 공유했습니다. Gumbel-max 샘플링 기반의 Tournament Sampling을 활용해 Claude, OpenAI, Gemini 등의 워터마크 생성기와 탐지기를 자체 구축하여 다양한 공격 기법을 테스트했습니다. 테스트 결과, 하이픈 교체나 마크다운 제거, 미국식/영국식 철자 변환 등 기존에 알려진 방식들은 워터마크 탐지를 무력화하는 데 실패했습니다. 약 300번의 테스트 중 유일하게 유효했던 방식은 단어의 40%를 삭제하는 것이었으나, 이는 텍스트의 가독성을 심각하게 훼손하는 것으로 나타났습니다. 최종적으로 연구자는 텍스트에 보이지 않는 문자를 삽입하는 방식만이 워터마크 탐지를 10/10 확률로 성공적으로 회피할 수 있다고 결론지었습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 I figured out a loophole to remove Claude watermark WITHOUT rephrasing
원문 보기 ↗