Claude Opus 5.5 'Max 모드' 토큰 사용량 논란…벤치마크 신뢰성 의문 제기
Max 모드 실행 시 토큰 사용량이 6배 급증하는데, 벤치마크는 이 기준인지 불분명하여 실제 운영 시 비용 효율성 재점검이 필요함.
요약
최근 Reddit의 r/ClaudeAI 커뮤니티에서 Anthropic의 Opus 5.5 모델에 도입된 'Max effort mode'에 대한 의문이 제기되었다. 해당 모드는 일반 모드 대비 6배 이상의 사용량을 소모하며, 벤치마크 결과가 이 모드를 기준으로 측정되었을 가능성이 논의되고 있다. 사용자가 일반적인 Medium이나 High 모드를 사용할 경우 실제 벤치마크와 동일한 성능을 경험하기 어렵다는 지적이다. 6배 이상의 높은 리소스 사용량에 대해 'Max effort mode'가 구체적으로 어떤 연산을 수행하는지에 대한 불투명성도 제기된 상태다. 실무자들은 Anthropic이 실제 서비스 환경과 벤치마크 환경 간의 괴리를 이용해 성능을 과장하고 있는 것은 아닌지 우려를 표하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Did Anthropic just find a new way to benchmax Opus 5.5 without actually giving subscribers that performance?
원문 보기 ↗