참고X
Gemini 3.7 Flash, ARC-AGI 벤치마크 결과 공개
추론 비용 대비 높은 성능으로 실무 에이전트 구축 시 모델 선택의 기준점이 될 수 있음.
요약
구글의 최신 모델인 Gemini 3.7 Flash가 ARC-AGI 벤치마크 테스트에서 뛰어난 성능과 비용 효율성을 증명했다. ARC-AGI-1 데이터셋에서 95.5%의 점수를 기록하며 작업당 0.12달러의 비용이 소요되는 것으로 확인됐다. 더 어려운 난이도의 ARC-AGI-2에서는 84.6%의 정확도를 보였으며, 작업당 비용은 0.25달러로 책정되었다. 이러한 결과는 Gemini 3.7 Flash가 기존 프론티어 모델들과 비교했을 때 매우 경쟁력 있는 비용 대비 성능을 갖추었음을 의미한다. 실무자들은 해당 수치를 통해 추론 및 문제 해결 작업에서 해당 모델의 경제적 활용 가능성을 확인할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @arcprize: Gemini 3.7 Flash from @Google on ARC-AGI (Verified): - ARC-AGI-2: 84.6%, $0.25/task - ARC-AGI-1: 95.5%, $0.12/task Gemini 3.7 Flas
원문 보기 ↗