참고AI타임스
앤트로픽, AI가 스스로 정렬 오류 수정하는 기술 공개
연구자가 직접 하던 정렬 작업을 AI가 자동 수행. 모델 안전성 강화의 새로운 경로를 제시함.
요약
앤트로픽은 28일 AI 에이전트를 활용해 모델의 정렬 오류를 자율적으로 수정하고 안전성을 높인 연구 결과 '자동화된 연구자는 정렬 오류를 안정적으로 완화할 수 있다'를 공개했다. 이번 연구는 '클로드 오퍼스 4.8' 기반의 자동화된 AI 연구자가 인간 연구자를 대신해 모델의 정렬 실패를 완화하는 과정을 담고 있다. 범용 자율 AI는 아니지만 명확한 평가 기준이 있는 영역에서 AI가 사후 훈련을 전담해 안전성 격차를 줄일 수 있음을 입증했다. 특히 기존 성능 저하 없이 모델의 안전성을 크게 개선했다는 점이 핵심 성과다. 이번 연구는 AI가 스스로 안전성 문제를 해결하는 자동화된 정렬 시스템의 가능성을 제시했다는 점에서 의의가 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 앤트로픽 "AI가 인간 대신 정렬 작업 수행…안전성 크게 높였다"
원문 보기 ↗