참고Reddit
최신 모델 4종(Claude Opus 5, Kimi K3, Grok 4.5, Gemini 3.6 Flash) 벤치마크 결과
새로 출시된 주요 모델들의 성능과 비용 효율성을 특정 태스크(Baba Is You) 기준으로 비교하여 실무 모델 선택에 유용합니다.
요약
최근 벤치마크 도구인 'baba-is-harbor'를 활용해 최신 AI 모델들의 성능 테스트가 진행되었습니다. 이번 테스트 대상 모델은 Claude Opus 5, Kimi K3, Grok 4.5, Gemini 3.6 Flash 등 7월에 새롭게 출시된 모델들입니다. 연구진은 각 모델의 벤치마크 성능을 재측정하며 성능과 비용 효율성을 비교 분석하고자 했습니다. 특히 Claude Opus 5와 Fable 5 간의 비용 비교와 함께, 테스트 모델 중 가장 높은 비용이 발생하는 모델이 무엇인지에 대한 검증을 수행했습니다. 해당 벤치마크 결과는 Reddit의 r/ClaudeAI 커뮤니티에서 공유되었습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Benchmarking Claude Opus 5, Kimi K3, Grok 4.5, and Gemini 3.6 Flash on Baba Is You
원문 보기 ↗