참고Reddit
중국 AntLing-3.0-flash 공개: 고효율 MoE 구조, API 전용 서비스
첫 토큰 응답 100ms 미만의 고속 모델. 툴 호출 및 고빈도 작업 처리를 위한 가벼운 대안으로 고려 가능.
요약
중국 개발사가 새로운 고속 실행 모델인 AntLing-3.0-flash를 출시했으며, 오는 8월 3일까지 무료로 공개한다. 이 모델은 124B 파라미터 규모(활성 파라미터 5.1B)의 Sparse MoE 구조를 채택했으며, 256K 컨텍스트 윈도우와 100ms 미만의 첫 토큰 응답 속도를 제공한다. 복잡한 추론보다는 툴 호출(tool calls)이나 대량의 단순 작업을 처리하는 효율적인 '실행 모델'을 지향하며, 이는 DeepSeek의 효율성 전략과 유사하다. 현재는 API 형태로만 제공되며 오픈 웨이트는 공개되지 않았다. 실무자들은 대규모 추론 모델과 이와 같은 저비용 고속 모델을 조합해 AI 워크플로우를 최적화하는 방안을 고려할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Chinese labs keep shipping cheap fast models new AntLing-3.0-flash is out and free for a week
원문 보기 ↗