참고팁Hacker News
LLM 생성 텍스트 워터마킹 원리: 토큰 선택의 비밀
LLM 출력물에 보이지 않는 워터마크를 심는 기술적 원리(로그잇 조작) 해설. 데이터 신뢰성 및 규제 대응 기술 이해.
요약
AI 텍스트 워터마크는 텍스트 내 캐릭터가 아닌 모델이 단어를 선택하는 과정인 '단어 간 선택 확률'을 조작하여 구현된다. 모델은 문장을 생성할 때 여러 후보 단어 중 확률에 따라 단어를 선택하는데, 워터마킹 기술은 이 선택 과정에 비밀 키를 적용해 특정 단어 선택에 미세한 가중치를 부여함으로써 패턴을 숨긴다. 구글은 2024년부터 Gemini 앱과 웹 서비스에 이 기술을 적용해왔으며, 2026년 8월 기준 Claude의 신규 모델들도 모델 수준에서 워터마크를 삽입하기 시작했다. 이러한 방식은 텍스트 내용을 변경하지 않으면서도 복사 및 붙여넣기 등에도 지워지지 않고 유지된다는 특징이 있다. Kirchenbauer 등의 연구와 구글의 SynthID 방식이 대표적인 워터마킹 구현 사례로 꼽힌다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 How AI text watermarking works
원문 보기 ↗