Anthropic, 中 기업들의 데이터 증류(Distillation) 공격 보고서 공개
Alibaba, Moonshot, DeepSeek 등 중국 모델들이 Claude의 추론 데이터를 무단 학습에 사용하고 있다는 분석.
요약
Anthropic은 Alibaba, Moonshot AI, DeepSeek 등 중국 AI 기업들이 자사의 Claude 모델 기능을 탈취하기 위한 '증류 공격(distillation attacks)'을 강화하고 있다고 보고했다. Anthropic은 최근 몇 달간 Claude의 에이전트 기능, 코딩, 데이터 분석, 논리적 추론 능력을 훔치려는 5개의 공격 캠페인에서 약 2억 건의 비정상적인 상호작용을 확인했다. 증류 공격은 모델의 응답 과정에서 사고 과정(chain of thought)을 추출해 소형 모델을 미세 조정(fine-tuning)하는 데 악용된다. Anthropic은 사용자가 내부 사고 과정을 볼 수 없도록 차단하고 있지만, 공격자들은 이를 우회하여 정보를 추출하는 기술을 사용하고 있다. OpenAI 또한 DeepSeek와 관련한 유사한 공격 사례를 보고한 바 있으며, AI 모델 간 기술 탈취 경쟁이 더욱 공격적인 양상을 보이고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Anthropic details distillation campaigns from Alibaba, Moonshot AI, and DeepSeek
원문 보기 ↗