참고Reddit
OpenAI(오픈AI) 텍스트 워터마크 기술의 한계와 우회 가능성 실증
워터마크가 100% 탐지 보증을 못 함을 시사. AI 생성물 판별 솔루션 도입 시 신뢰도 계산에 참고 필요.
요약
OpenAI는 EU AI 법(Article 50(2))의 출처 규정 준수를 위해 텍스트 워터마크 기술인 'textGrain'을 발표했으나, 그 신뢰성에 의문이 제기되고 있다. OpenAI 자체 데이터에 따르면 동의어 교체율이 10%일 때 탐지율은 92%에서 66%로 떨어지며, 25% 교체 시 17%까지 급락하는 것으로 나타났다. 특히 수학적 내용이나 짧은 문장은 워터마크 탐지가 거의 불가능하다. 한 개발자가 공개한 'attack lab'에서는 동의어 교체나 번역 과정을 거치면 워터마크의 p-value가 즉각 붕괴하는 현상을 실시간으로 확인할 수 있다. 결론적으로 OpenAI는 워터마크가 탐지되지 않는다고 해서 그것이 인간이 작성했다는 증거가 되지는 않는다고 명시하고 있어, AI 탐지 도구 활용 시 주의가 필요하다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 OpenAI's text watermark can't prove you didn't write something. I built a lab where you can watch it die.
원문 보기 ↗