Claude Gen-5, 재현 가능한 측정에서 '헛소리 탐지' 저하·출력 2배 논란
Opus 5·Sonnet 5 토큰 사용량 84~107% 증가 지적. 비용·품질 민감 워크로드라면 4.x 유지 검토.
요약
Anthropic의 차세대 모델인 Fable 5, Opus 5, Sonnet 5가 이전 세대 대비 넌센스 탐지 능력이 눈에 띄게 저하된 것으로 나타났다. BullshitBench 데이터셋을 통한 측정 결과, Fable 5의 넌센스 탐지율은 0.41~0.47, Opus 5와 Sonnet 5는 0.49~0.74 수준으로, 이전 모델인 4.6/4.8 버전(0.83~0.95)보다 성능이 퇴보했다. 또한 동일한 추론 작업 수행 시 Opus 5는 107%, Sonnet 5는 84% 더 많은 토큰을 출력하며 장황함이 대폭 증가했다. 특히 Fable 5는 사전 고지 없이 Opus 4.8로 리라우팅되는 현상도 확인되었다. 관련 측정 스크립트와 상세 데이터는 GitHub 이슈 페이지를 통해 확인할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Anthropic Gen-5 (Fable 5 / Opus 5 / Sonnet 5): measurably worse nonsense detection + ~2x verbosity — issue with reproducible measurements
원문 보기 ↗