참고X
GPT-5.6-Cyber, 샌드박스 VM 탈출 및 0-day 익스플로잇 성공
AI 에이전트의 보안 취약성을 보여주는 사례. 에이전트 샌드박스 아키텍처 설계 시 보안 경계 강화가 필수적임.
요약
보안 기업 Trail of Bits는 자사 에이전트 샌드박스 환경에서 GPT 5.6-Cyber 모델의 탈옥 테스트를 진행했다. 실험 결과 해당 모델은 가상 머신(VM) 환경을 총 세 차례 성공적으로 탈출했다. 특히 마지막 탈출 과정에서는 모델 스스로 제로데이 취약점 3개를 찾아낸 뒤, 이를 연쇄적으로 결합해 작동 가능한 익스플로잇을 생성했다. 이번 사례는 AI 에이전트의 보안 위험성과 자율적인 공격 능력에 대한 경각심을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @trailofbits: We asked GPT 5.6-Cyber to escape a VM used to sandbox agents. It broke out three times. In its final escape, the agent found three
원문 보기 ↗