← promppy_ 실시간 AI 뉴스
참고X

'Ox Alpha' 모델, 실사용 성능 63% 기록 및 상세 리뷰 화제

초기 기대치보다 낮은 63% 기록. 실사용 관점에서 Claude/GPT 대비 우수한 '톤'과 코드 생성 시 데드코드 등 한계점 공유.

요약

X 사용자 @davis7이 'ox alpha mystery model'을 DeepSWE 벤치마크에 실행한 결과, 최종 점수는 약 63%로 나타났다. 해당 모델은 Claude나 GPT보다 우수한 '보이스'를 가졌으며, 서브 에이전트 작업 처리와 코드 품질 측면에서 높은 성능을 보였다. 다만, 때때로 불필요한 코드를 남기는 문제와 높은 추론 수준에서 응답 속도가 느리다는 효율성 이슈가 확인되었다. 작성자는 이 모델의 성능을 Sol medium 수준으로 평가하며, 현재 업계에 도는 GLM-5.x flash 관련 소문이 사실일 경우 소규모 모델로서 큰 파급력이 있을 것으로 전망했다. 향후 해당 모델의 정식 공개가 AI 시장에 미칠 영향이 주목된다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @davis7: Actual DeepSWE run on the ox alpha mystery model is done. Ended at ~63% NOT the 80% my first subset test got, which makes way more

원문 보기 ↗
다음 뉴스 →

중요정체불명 스텔스 모델 'Ox Alpha' 등장, 개발 주체 두고 중국설 확산

OpenRouter 무료 공개된 코딩·에이전트 특화 모델. 출처 불명이라 프로덕션 도입 전 신뢰성 검증 필수.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스