'Ox Alpha' 모델, 실사용 성능 63% 기록 및 상세 리뷰 화제
초기 기대치보다 낮은 63% 기록. 실사용 관점에서 Claude/GPT 대비 우수한 '톤'과 코드 생성 시 데드코드 등 한계점 공유.
요약
X 사용자 @davis7이 'ox alpha mystery model'을 DeepSWE 벤치마크에 실행한 결과, 최종 점수는 약 63%로 나타났다. 해당 모델은 Claude나 GPT보다 우수한 '보이스'를 가졌으며, 서브 에이전트 작업 처리와 코드 품질 측면에서 높은 성능을 보였다. 다만, 때때로 불필요한 코드를 남기는 문제와 높은 추론 수준에서 응답 속도가 느리다는 효율성 이슈가 확인되었다. 작성자는 이 모델의 성능을 Sol medium 수준으로 평가하며, 현재 업계에 도는 GLM-5.x flash 관련 소문이 사실일 경우 소규모 모델로서 큰 파급력이 있을 것으로 전망했다. 향후 해당 모델의 정식 공개가 AI 시장에 미칠 영향이 주목된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @davis7: Actual DeepSWE run on the ox alpha mystery model is done. Ended at ~63% NOT the 80% my first subset test got, which makes way more
원문 보기 ↗