← promppy_ 실시간 AI 뉴스
참고Reddit

최신 모델 4종(Claude Opus 5, Kimi K3, Grok 4.5, Gemini 3.6 Flash) 벤치마크 결과

새로 출시된 주요 모델들의 성능과 비용 효율성을 특정 태스크(Baba Is You) 기준으로 비교하여 실무 모델 선택에 유용합니다.

요약

최근 벤치마크 도구인 'baba-is-harbor'를 활용해 최신 AI 모델들의 성능 테스트가 진행되었습니다. 이번 테스트 대상 모델은 Claude Opus 5, Kimi K3, Grok 4.5, Gemini 3.6 Flash 등 7월에 새롭게 출시된 모델들입니다. 연구진은 각 모델의 벤치마크 성능을 재측정하며 성능과 비용 효율성을 비교 분석하고자 했습니다. 특히 Claude Opus 5와 Fable 5 간의 비용 비교와 함께, 테스트 모델 중 가장 높은 비용이 발생하는 모델이 무엇인지에 대한 검증을 수행했습니다. 해당 벤치마크 결과는 Reddit의 r/ClaudeAI 커뮤니티에서 공유되었습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 Benchmarking Claude Opus 5, Kimi K3, Grok 4.5, and Gemini 3.6 Flash on Baba Is You

원문 보기 ↗
다음 뉴스 →

중요Copilot for Word를 경유한 '프롬프트 주입' 웜 바이러스 발견

문서 내 숨겨진 명령이 AI 에이전트로 전파되어 자가 복제되는 취약점. 문서 기반 AI 워크플로우 보안 점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스