Astra vs GPT-5.6 Sol: DeepSWE 벤치마크 효율성 비교
Astra가 GPT-5.6 Sol 대비 절반의 토큰과 단계로 유사한 성능을 냄을 입증. 비용 최적화 전략 수립 시 참고.
요약
최근 DeepSWE 벤치마크 결과에서 Astra 모델이 압도적인 효율성을 입증하며 주목받고 있다. Astra는 3만 개의 출력 토큰과 29단계의 과정을 통해 74%의 점수를 기록하며 6.52달러의 비용이 소요되었다. 반면 비슷한 성능인 73%를 기록한 GPT-5.6 Sol 모델은 6만 개의 출력 토큰과 61단계의 과정이 필요하며 6.46달러의 비용이 발생했다. Sol 모델이 출시된 지 수개월밖에 되지 않았음에도 불구하고, Astra가 훨씬 적은 토큰과 단계를 통해 유사한 수준의 높은 성능을 낸다는 점이 핵심이다. 이러한 결과는 AI 모델의 작업 효율성과 비용 최적화 측면에서 Astra가 경쟁 우위를 가질 수 있음을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @haider1: how tf is Astra this damn efficient gets 74% with just 30k output tokens / 29 steps at $6.52 on the DeepSWE bench GPT-5.6 Sol gets
원문 보기 ↗