독일 알레프 알파 'Kolibri' 모델 상세 성능 분석: 벤치마크 결과 공개
AIME 96.9%, GPQA 84.3% 기록. 소형 모델 효율성 검증 및 벤치마크 데이터로서 참고 가치 있음.
요약
독일의 Aleph Alpha가 새로운 AI 모델 'Kolibri'를 공개하며 유럽 AI 기술력을 입증했다. Kolibri는 총 78B 파라미터 규모지만, 토큰당 3.46B만 활성화하는 효율적인 구조를 갖췄으며 Apache 2.0 라이선스로 가중치가 공개되었다. Aleph Alpha의 자체 평가 결과, AIME 2025에서 96.9%, GPQA Diamond에서 84.3%의 높은 점수를 기록했다. 특히 독일어 성능은 Qwen3.5 35B-A3B와 GPT-OSS 120B를 근소하게 앞서는 성과를 보였다. 반면 코딩 성능은 SWE-Bench Verified 기준 66.4%로 Qwen3.6의 73.8%에는 미치지 못했다. 이번 사례는 지역과 관계없이 고성능 소형 모델을 훈련할 수 있는 기술적 장벽이 사실상 사라지고 있음을 시사한다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @kimmonismus: Aleph Alpha’s Kolibri looks like a surprisingly strong AI release from Germany! I did not expect that but respect where respect is
원문 보기 ↗