오픈소스 모델 기반 에이전트 시스템, MLE-Bench 65% 달성… 비용 1/10 수준
Claude Code 대비 10% 비용으로 유사 성능을 낸 사례. 병렬 리서치 에이전트 아키텍처 도입 시 비용 구조 혁신 가능.
요약
최근 공개된 오픈소스 모델이 MLE-Bench에서 약 65%의 골드 메달을 획득하며 성능과 비용 효율성 측면에서 주목받고 있다. 해당 모델은 약 3,000달러의 토큰 비용으로 Claude Code와 Opus 4.8 스택(약 38,000달러 소요)보다 더 많은 골드를 획득하며 뛰어난 가성비를 입증했다. 이번 결과는 단일 에이전트가 단일 경로를 탐색하는 기존 방식 대신, 병렬 연구 동료와 공유 메모리를 활용하는 시스템 구조의 혁신을 보여준다. 이는 더 큰 모델이 반드시 더 나은 결과를 보장하지 않음을 시사하며, 시스템 설계 최적화가 핵심임을 강조한다. 이번 오픈소스 모델의 등장은 소규모 퀀트 샵에게 전략 발굴 비용의 기준을 재정의하는 계기가 될 것으로 보인다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ai_explorer25: ~65% gold on MLE-Bench for ~$3K in tokens, vs ~$38K for the Claude Code + Opus 4.8 stack and it won more golds. An open-source mod
원문 보기 ↗