OpenAI 연구원, Astra '모니터링 불가' 우려 반박…CoT 감시 여전히 유효
프론티어 모델 계산 그래프 깊이는 GPT-4의 2배 이내. CoT 모니터링 취약해지는 추세라 안전성 설계 참고할 것.
요약
OpenAI의 핵심 연구원인 @merettm은 현재 프론티어 모델의 계산 그래프 깊이가 GPT-4와 비교했을 때 2배 이내라고 밝혔다. 최근 Astra를 포함한 모델들의 계산 그래프 깊이가 크게 변하지 않았음을 시사하며, 혼란스러운 보도로 인해 모델의 모니터링이 불가능해지는 상황을 방지하고자 한다. OpenAI는 첫 추론 모델부터 사고 과정(Chain-of-Thought) 모니터링 기법을 사용하여 모델 정렬이 훈련 분포 밖에서도 어떻게 일반화되는지 관찰해 왔다. 하지만 현재 이러한 모니터링 기법이 아키텍처 변화와는 무관하게 취약해지고 있으며, 부정적인 방향으로 흐르고 있다고 평가했다. 이에 OpenAI는 사고 과정 모니터링을 강화하는 것을 현재 연구 프로그램의 핵심 목표로 삼고 있으며, 관련하여 구체적인 대응 방안을 곧 발표할 예정이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @merettm: I want to prevent a race into unmonitorability kicked off by confused reporting. The depth of the computation graph for our presen
원문 보기 ↗