GPT-6 Astra, 확장 TIP(Task-in-Prompt) 공격으로 출시 24시간 만에 탈옥
암호·코드 실행 등에 유해 목표를 숨기는 TIP 계열 공격 여전히 유효. 프롬프트 인젝션 방어 재점검 필요.
요약
최근 공개된 GPT-6 Astra가 출시 24시간 만에 'Task-in-Prompt(TIP)' 공격을 통해 탈옥되었다는 소식이 전해졌다. 이번 공격은 ACL 2025 논문에서 제시된 TIP 공격 기법에 4가지 추가 기법을 결합한 방식으로 이루어졌다. TIP 공격은 암호 해독이나 파이썬 코드 실행처럼 겉으로 보이는 과제 속에 유해한 목표를 숨겨 모델의 지시 이행 능력을 악용하는 방식이다. 연구자는 기존의 최소 TIP 공격만으로는 GPT-6를 뚫기 부족해 해당 기법을 재구성했다고 밝혔다. 현재 연구자는 상세 내용을 공개하는 대신 OpenAI 측에 비공개로 전달한 상태이며, 해당 연구자는 1년 전 GPT-5 출시 당시에도 1시간 만에 탈옥에 성공했던 이력이 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 GPT-6 reportedly jailbroken within 24 hours using an extended Task-in-Prompt (TIP) attack [N]
원문 보기 ↗