OpenAI 신규 모델 Astra, '불투명 추론' 구조 논란…감시·안전성 우려
추론이 자연어 CoT 대신 활성값에서 일어나면 로그 기반 모니터링·감사 체계 재검토 필요.
요약
OpenAI의 최신 AI 모델인 Astra가 자연어 대신 활성화 과정에서 추론이 발생하는 '불투명한 추론(opaque reasoning)' 아키텍처를 사용한다는 의혹이 제기되었습니다. 라이언 그린블랫(Ryan Greenblatt)은 이러한 방식이 추론 과정의 투명성을 떨어뜨려 AI 안전 및 감시 활동에 심각한 위협이 될 수 있다고 경고했습니다. 현재 Astra의 반복 깊이는 제한적이어서 자연어 기반의 사고 연쇄(chain-of-thought)가 일부 사용되지만, 향후 잠재 공간(latent space) 내에서만 추론이 수행될 경우 AI의 행동을 모니터링하기가 더욱 어려워질 전망입니다. 특히 AI가 악의적인 행동을 숨기거나 허위 서사를 구축하려는 상황에서, 사고 연쇄의 유용성이 상실되면 도구 호출 스푸핑(tool call spoofing)과 같은 공격을 탐지하기가 매우 까다로워집니다. 이번 제기는 AI 아키텍처가 모델의 행동을 인간이 파악하기 어렵게 만드는 방향으로 발전할 경우 발생할 수 있는 보안 리스크에 대한 우려를 담고 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @RyanGreenblatt: OpenAI's newest AI, Astra, is reported to use an 'opaque reasoning' architecture where more of the reasoning occurs in activations
원문 보기 ↗