신규 모델 'Hark Handoff' 등장: GPT-5.5 대비 비용 90% 절감 주장
Reddit 커뮤니티에서 성능 우위를 주장하는 신규 모델 소식. 실제 벤치마크 검증 전까진 참고용으로 활용.
요약
최근 AI 커뮤니티에서 주목받는 'Hark Handoff'는 Online Mine 2Web 벤치마크에서 97.7점, WebTail Bench에서 68.6점을 기록하며 주요 성능 지표에서 GPT-5.5 OPUS를 상회하는 결과를 보였다. 해당 모델은 GPT-5.5 대비 90% 저렴한 백만 토큰당 2.37달러의 비용 효율성을 강점으로 내세운다. 학습 방식으로는 미공개 베이스 모델에 SFT(Supervised Fine-Tuning)를 적용하고, DeepMind의 AlphaGo 방식과 유사한 비동기식 강화학습(GRPO 알고리즘)을 결합했다. 1~3초의 빠른 응답 속도를 주장하지만, 컴퓨터 사용 에이전트(CUA)의 핵심 문제인 페이지 렌더링 및 상태 해석 과정에서 약 10초가량의 지연 시간이 추가되는 한계가 있다. 실무자들은 이러한 지연 시간 이슈에도 불구하고, CUA 분야의 발전 가능성을 긍정적으로 평가하고 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Have you checked out Hark Handoff? It has scored better on EYL than GPT 5.5 OPUS 4.8 at 90% less cost
원문 보기 ↗