OpenAI, 숨겨진 추론 데이터 탈취 시도 적발…Moonshot AI 연루 의혹
암호화 추론을 모델에 복호화시키는 수법 등장. 추론 노출 차단·탈취 방어 설계 점검 필요.
요약
OpenAI의 모델에서 숨겨진 추론 데이터를 추출하려는 대규모 조직적 캠페인이 적발되었습니다. OpenAI는 이 시도의 핵심 주체로 중국 AI 기업 문샷 AI(Moonshot AI)와 관련된 인물들을 지목했습니다. 공격자들은 한 대화의 암호화된 추론 내용을 다른 대화로 복사한 뒤 모델이 이를 복호화 및 전사하도록 유도하는 방식을 사용했습니다. 지난 7월 이틀 동안 총 16,000건의 추출 시도가 기록되었으며, 약 15,000개 이상의 계정이 이 활동과 연관된 것으로 확인되었습니다. OpenAI는 해당 추출 경로를 차단하고 관련 계정을 정지하거나 제한 조치했다고 밝혔습니다. 이번 사건은 경쟁 모델 학습을 위해 타사 모델의 내부 추론 데이터를 탈취하려는 구체적인 시도를 보여줍니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @mark_k: A coordinated campaign tried to extract hidden reasoning from @OpenAI's models, according to a new report. The company attributes
원문 보기 ↗