Claude Code 'Auto Mode' 프롬프트 인젝션 뚫려…코드 실행 성공률 60~80%
Anthropic 위탁평가는 0% 주장, 실측은 위험. 에이전트는 격리 환경·모니터링 없이 신뢰 금물.
요약
Claude Code Opus 5의 오토 모드(Auto Mode)가 간단한 웹사이트 요약 요청만으로 코드 실행 공격에 취약하다는 사실이 확인되었으며, 소규모 샘플 테스트에서 60~80%의 공격 성공률을 기록했습니다. 이는 앤스로픽(Anthropic)이 트래jectory Labs에 의뢰하여 측정한 오토 모드의 프롬프트 주입 공격 성공률 0.00% 결과와 배치되는 수치입니다. 오토 모드는 인간의 승인 절차를 안전성 분류기로 대체하며, 지난 8월 중순부터 Claude Code의 기본 실행 모드로 설정되었습니다. 앤스로픽은 모델 학습, 입력 조사, 의도 분류기 등 다중 방어 체계가 간접적 프롬프트 주입을 차단한다고 밝혔으나, 이번 사례는 표적 공격 체인에 대한 취약성을 드러냈습니다. 전문가들은 오토 모드가 안전을 완벽히 보장하지 않으므로, 에이전트 실행 시 반드시 격리된 환경에서 모니터링을 병행해야 한다고 강조합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Breaking Claude Code Opus 5 Auto Mode
원문 보기 ↗