참고X
Qwen3.8-Flash 벤치마크 공개: SWE-bench 및 수학적 추론 성능
SWE-bench Pro 62.5, MathVision 95.7 등 주요 지표가 업데이트되어 경량 모델 도입 검토 시 참고 가능.
요약
알리바바의 새로운 AI 모델 Qwen3.8-Flash가 출시되었다. 해당 모델은 DeepSWE 1.1에서 58.7, SWE-bench Pro에서 62.5, CoWorkBench에서 73.9, AndroidWorld에서 84.5, MathVision에서 95.7의 벤치마크 점수를 기록했다. 기본 컨텍스트 윈도우는 262K를 지원하며, YaRN 기술을 통해 최대 1M까지 확장이 가능하다. 우수한 벤치마크 성능과 확장성을 바탕으로 다양한 AI 작업 처리에 활용될 것으로 기대된다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @ai_for_success: Qwen3.8-Flash is here 🔥 - 58.7 on DeepSWE 1.1, 62.5 on SWE-bench Pro, 73.9 on CoWorkBench, 84.5 on AndroidWorld, and 95.7 on Math
원문 보기 ↗