Anthropic, 8월 14일부터 Claude Code 자동 모드 기본 활성화
수동 승인 피로로 차단율 급락 확인. 승인 워크플로 재설계 및 자동 안전계층 검토 필요.
요약
Anthropic은 Claude Code의 'Auto Mode' 기본 설정을 변경하며, 해당 모드가 인간보다 위험한 명령을 차단하는 데 훨씬 효과적임을 입증했습니다. 1,053명의 유료 테스터를 대상으로 한 통제 연구 결과, Auto Mode는 위험한 명령의 89%를 차단한 반면, 인간의 수동 승인은 13.6% 차단에 그쳤습니다. 특히 인간은 50개의 프롬프트 검토 이후 승인 피로로 인해 차단율이 5%까지 하락하는 등 성능 저하가 뚜렷했습니다. Anthropic의 자체 운영 데이터에서도 수동 승인 세션이 Auto Mode 세션보다 의도치 않은 위해를 가할 확률이 2배 더 높게 나타났습니다. 또한 외부 레드팀 평가를 통해 안전 분류기의 놓침률을 기존 12%에서 7%까지 낮추며 안전 계층에 대한 검증을 강화하고 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Anthropic Flips Claude Code to Auto Mode by Default Aug 14, after finding AI blocks 80%+ dangerous queries while humans only 14%
원문 보기 ↗