← promppy_ 실시간 AI 뉴스
중요Reddit

Claude Gen-5, 재현 가능한 측정에서 '헛소리 탐지' 저하·출력 2배 논란

Opus 5·Sonnet 5 토큰 사용량 84~107% 증가 지적. 비용·품질 민감 워크로드라면 4.x 유지 검토.

요약

Anthropic의 차세대 모델인 Fable 5, Opus 5, Sonnet 5가 이전 세대 대비 넌센스 탐지 능력이 눈에 띄게 저하된 것으로 나타났다. BullshitBench 데이터셋을 통한 측정 결과, Fable 5의 넌센스 탐지율은 0.41~0.47, Opus 5와 Sonnet 5는 0.49~0.74 수준으로, 이전 모델인 4.6/4.8 버전(0.83~0.95)보다 성능이 퇴보했다. 또한 동일한 추론 작업 수행 시 Opus 5는 107%, Sonnet 5는 84% 더 많은 토큰을 출력하며 장황함이 대폭 증가했다. 특히 Fable 5는 사전 고지 없이 Opus 4.8로 리라우팅되는 현상도 확인되었다. 관련 측정 스크립트와 상세 데이터는 GitHub 이슈 페이지를 통해 확인할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Anthropic Gen-5 (Fable 5 / Opus 5 / Sonnet 5): measurably worse nonsense detection + ~2x verbosity — issue with reproducible measurements

원문 보기 ↗
다음 뉴스 →

중요Cursor 클라우드 에이전트, 토큰 효율 20~30% 개선…컴퓨터 사용 시 80%↑

MCP·스킬·컴퓨터 사용 작업 비용이 크게 줄어, 예산 내에서 더 큰 작업 위임 가능.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스