OpenAI(오픈AI) 'textGrain' 워터마크 도입…우회 기술 오픈소스 공개
워터마크 회피를 위한 문장 재구성 기법 공개. 모델 출력물에 대한 통제력 확보를 위해 참고할 만함.
요약
OpenAI가 EU 지역 ChatGPT 및 Codex 사용자들을 대상으로 'textGrain'이라는 통계적 텍스트 워터마크 기술을 도입한다고 발표했다. 이는 Anthropic의 Claude 모델 워터마크와 유사하게 단어 선택에 통계적 신호를 삽입하는 방식으로, 단순 텍스트 수정이나 문자열 정화로는 제거가 어렵다. 이에 한 개발자는 LLM이 생성한 텍스트를 재작성(rewrite)하여 워터마크 신호를 우회하는 도구를 오픈소스(MIT 라이선스)로 공개했다. 테스트 결과, 가벼운 동의어 교체로는 신호 제거가 어렵지만, 다른 모델을 통한 전면 재작성 시 감지 임계값 아래로 신호를 낮출 수 있는 것으로 나타났다. 이번 사례는 AI 생성물 식별 기술과 이를 회피하려는 기술 간의 경쟁이 본격화되고 있음을 보여준다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 OpenAI is following Anthropic with statistical text watermarks in AI outputs, so I open-sourced my rewrite-based remover as a workaround
원문 보기 ↗