참고AI타임스
AI 모델 7종, 월드컵 베팅 벤치마크 결과 공개…실전 의사결정 능력 겨뤄
지식 평가를 넘어 실시간 데이터 대응 능력을 측정하는 벤치마크. 모델 선택의 새로운 척도로 참고할 만함.
요약
AI 스타트업 옵사이드는 지식 측정 중심의 기존 벤치마크를 넘어, AI 모델의 실전 의사결정 능력을 평가하는 'AI 베팅 아레나'를 공개했다. 이 벤치마크는 7종의 AI 모델이 2026 월드컵 경기 결과를 예측하고 실시간 배당률에 따라 베팅하는 방식으로 진행된다. 평가 대상에는 GPT-5.5, 클로드 오퍼스 4.8, 제미나이 3.5 플래시, 딥시크-V4 등 최신 모델이 포함되었다. 실험 결과 제미나이 3.5 플래시가 1위를 차지한 반면, 클로드 오퍼스 4.8은 최하위를 기록했다. 이번 실험은 고정된 지식 데이터가 아닌 유동적인 실시간 데이터를 활용해 AI의 추론 및 예측 능력을 검증했다는 점에서 차별화된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 AI 모델들의 월드컵 베팅 결과는...제미나이 1위·클로드 최하위
원문 보기 ↗