← promppy_ 실시간 AI 뉴스
참고Reddit

Terminal-Bench 3.0: 59번의 시도 중 유일하게 통과한 고난도 작업 공유

기존 벤치마크 기록을 갱신한 프롬프트/에이전트 접근 방식 공유로, 복잡한 로컬 작업 수행 시 참고 가능.

요약

Terminal-Bench 3.0의 'ico-path-patch' 작업은 바이너리 리버스 엔지니어링과 핫 패치를 수행해야 하는 고난도 벤치마크로, 현재까지 11개 모델 및 에이전트 조합으로 진행된 59회의 공개 실행에서 모두 실패를 기록했습니다. 해당 과제는 19개의 체크포인트를 통과해야 하며 90분의 제한 시간이 존재합니다. 테스트된 모델에는 Opus 5, Sonnet 5, Fable 5, GPT-5.6 시리즈, Grok 4.5/4.6, GLM 5.2, Devin 등이 포함되어 있습니다. 작성자는 본인의 접근 방식을 통해 gpt-5.6-sol 모델로 해당 과제를 통과했다고 밝혔으나, 이는 4번의 시도와 수정 끝에 얻은 결과라고 덧붙였습니다. 작성자는 자신의 방법론이 로컬 모델에서도 유효한지 검증하기 위해 오픈 소스 커뮤니티의 추가적인 테스트를 요청하고 있습니다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 A benchmark task with 59 public runs across 11 model/agent configs and zero passes — my method got a pass, but it's all closed models. Anyone want to try it locally?

원문 보기 ↗
다음 뉴스 →

중요'추론 칩' 에치드(Etched), 기업 가치 29조 원 돌파…한 달 만에 2배로

추론 전용 칩 경쟁 본격화. GPU 대비 저렴한 추론 인프라 대안 부상 여부 주시할 시점.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스