Sapient, 코딩 에이전트 PRAXIST 공개: Claude Code 대비 비용 1/12·성능 44% 우위 주장
약한 오픈모델로도 75개 과제서 비용·성능 앞선다는 주장. 벤치마크 재현성 검증 필요.
요약
AI 에이전트 개발사 Sapient가 기존 코딩 에이전트의 한계를 해결한 새로운 벤치마크 결과를 발표했습니다. 75개 연구 과제 테스트 결과, Sapient의 PRAXIST는 3,054달러의 비용으로 Claude Code 및 Opus 4.8(38,370달러 소요) 대비 44% 더 높은 성과를 기록했습니다. 이 시스템은 문제의 원인을 모르는 상태에서도 다수의 시도를 병렬로 실행하고 실패 사례를 학습하여 최적의 경로를 찾는 방식으로 작동합니다. 실제로 로켓 착륙 시뮬레이션의 안전 착륙률을 17.12%에서 100%로 끌어올렸고, 퀀트 벤치마크에서도 53.04%의 워크 포워드 CAGR을 달성했습니다. 현재 GitHub를 통해 설치 및 사용 방법을 제공하며, 기존 프로젝트에서 Codex나 Claude Code와 연동해 메트릭과 예산을 설정하는 방식으로 운용할 수 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @undefinedKi: Sapient just solved the biggest limitation of coding agents, and here's why it changes everything. They published the benchmark to
원문 보기 ↗