중요X
에이전트 특화 하이브리드 확산 모델 'Celeris-1 Magnus' 공개, 속도·정확도 동시 우위 주장
τ³-bench 뱅킹서 GPT-5.6 대비 정확도·응답속도 앞선다지만, 벤더 자체 벤치라 실측 검증 필요.
요약
Celeris AI는 에이전트 작업 수행을 위해 설계된 새로운 모델 Celeris-1 Magnus를 공개했다. 이 모델은 τ³-bench 뱅킹 테스트에서 41.2%의 성능을 기록하며 55초의 중앙 처리 시간을 달성했다. 비교 대상인 GPT-5.6-sol은 동일한 테스트에서 38.1%의 성능과 79초의 처리 시간을 기록했다. Celeris-1 Magnus는 qwen3.8-27b를 기반으로 한 하이브리드 확산(hybrid diffusion) 모델이다. 해당 모델은 에이전트 워크로드에 최적화되어 설계된 것이 특징이다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @Celeris_ai: Introducing Celeris-1 Magnus. A model built for agentic work. On τ³-bench banking, Magnus delivers 41.2% at a 55-second median, ag
원문 보기 ↗