← promppy_ 실시간 AI 뉴스
중요X

Artificial Analysis, 'Capability Indices v1.1' 공개: 직무별 모델 성능 평가 강화

재무·법률·엔지니어링 등 6개 직무 벤치마크 업데이트. 실무 워크로드별 모델 선정 근거로 참고 가치.

요약

Artificial Analysis는 핵심 지능 지수 v4.3과 전문화된 평가를 결합한 'Capability Indices v1.1'을 발표하며 도메인 튜닝을 강화했다. 이번 업데이트로 금융·회계, 전략·운영, 법률, 의료, 엔지니어링, 경제 등 6개 분야 인덱스에 Agentic Tool Use와 AA-Briefcase 등이 추가되었으며, Agentic Customer Interaction은 제외되었다. 평가 결과, Claude Fable 5.1(max)이 6개 인덱스 모두에서 1위를 차지했으며 GPT-6 Astra(max)가 그 뒤를 이었다. 오픈 웨이트 모델들 또한 경쟁력을 보였는데, Kimi K3(max)는 금융·회계, 법률, 경제 분야에서 상위권에 올랐다. 또한 DeepSeek V4.1 Flash(max)와 GLM-5.3(max)도 전략·운영, 의료, 엔지니어링 분야에서 각각 선두권을 기록하며 주요 오픈 모델의 입지를 다졌다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @ArtificialAnlys: Announcing Artificial Analysis Capability Indices v1.1, updated with stronger domain tuning, combining slices of core Intelligence

원문 보기 ↗

광고

다음 뉴스 →

중요OpenAI 봇, RubyGems 캐싱 취약점 악용 및 스크래핑 정황 포착

AI 봇이 패키지 저장소를 악용한 실사례. 크롤러 차단·캐시 정책 등 인프라 방어 재점검 필요.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스