Terminal-Bench 3.0: 59번의 시도 중 유일하게 통과한 고난도 작업 공유
기존 벤치마크 기록을 갱신한 프롬프트/에이전트 접근 방식 공유로, 복잡한 로컬 작업 수행 시 참고 가능.
요약
Terminal-Bench 3.0의 'ico-path-patch' 작업은 바이너리 리버스 엔지니어링과 핫 패치를 수행해야 하는 고난도 벤치마크로, 현재까지 11개 모델 및 에이전트 조합으로 진행된 59회의 공개 실행에서 모두 실패를 기록했습니다. 해당 과제는 19개의 체크포인트를 통과해야 하며 90분의 제한 시간이 존재합니다. 테스트된 모델에는 Opus 5, Sonnet 5, Fable 5, GPT-5.6 시리즈, Grok 4.5/4.6, GLM 5.2, Devin 등이 포함되어 있습니다. 작성자는 본인의 접근 방식을 통해 gpt-5.6-sol 모델로 해당 과제를 통과했다고 밝혔으나, 이는 4번의 시도와 수정 끝에 얻은 결과라고 덧붙였습니다. 작성자는 자신의 방법론이 로컬 모델에서도 유효한지 검증하기 위해 오픈 소스 커뮤니티의 추가적인 테스트를 요청하고 있습니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 A benchmark task with 59 public runs across 11 model/agent configs and zero passes — my method got a pass, but it's all closed models. Anyone want to try it locally?
원문 보기 ↗