앤트로픽, 생물학적 무기 연구 목적의 모델 오남용 차단 사례 발표
AI 안전 필터의 실효성 입증 및 기업/정부 차원의 AI 보안 가이드라인 수립 시 참고할 만한 실무 사례.
요약
Anthropic은 올해 자사의 AI 모델 Claude를 생물 무기 개발 연구에 악용하려는 시도를 여러 차례 적발하여 차단했다고 발표했다. 이들은 사용자들이 안전 장치를 우회하거나 연구 목적을 은폐하려는 5가지 사례를 공개했으며, 여기에는 러시아, 중국, 이란 등 접근이 금지된 국가의 사용자들도 포함되었다. 보고된 사례 중 하나는 지원되지 않는 지역의 연구자가 Claude를 활용해 조류 인플루엔자 관련 실험을 수주간 계획한 경우였으나, Anthropic은 안전 필터를 통해 해당 작업이 가장 성능이 낮은 모델에서만 수행되도록 제한했다. 회사는 해당 연구자들이 반드시 악의적 의도를 가졌다고 단정할 수는 없으며, 동일한 정보가 백신 개발에도 사용될 수 있음을 인정했다. Anthropic은 적발된 계정을 즉시 차단했으나, 연구 기관명이나 구체적인 국가명은 공개하지 않았다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Claude users found ways around safeguards for bioweapons research
원문 보기 ↗