← promppy_ 실시간 AI 뉴스
참고팁X

GPT-6.1 Sol 벤치마크 결과, 평가 환경에 따른 성능 편차 확인

Codex와 mini-swe 등 평가 프레임워크에 따라 모델 성능 지표가 다르게 나타날 수 있음을 시사합니다.

원문 제목 @theo: Updated run just finished. GPT-6.1 Sol still crushes. Turns out it performs WAY better in Codex than in mini-swe (what Artificial

원문 보기 ↗

광고

다음 뉴스 →

중요백악관, '초지능 협약' 발표…프런티어 AI 책임 공동 서약

미 정부 주도 AI 안전·책임 프레임워크. 글로벌 모델 배포·규제 정합성 사전 점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스