참고X
Kimi, 'Delta Attention' 공개…디코딩 속도 6.3배 향상 및 KV 캐시 최적화
추론 효율성을 극대화한 신규 아키텍처. 장기 문맥 처리가 필요한 엔지니어링 워크플로우라면 참고할 가치가 있음.
요약
Kimi가 2.8조 개의 파라미터와 100만 토큰의 컨텍스트 윈도우를 지원하는 네이티브 멀티모달 모델을 발표했다. 핵심 기술인 Kimi Delta Attention은 100만 토큰 컨텍스트 환경에서 디코딩 속도를 최대 6.3배 높이고 KV 캐시 메모리 사용량을 최대 75%까지 절감한다. 또한 Attention Residuals 기술을 도입해 2% 미만의 추가 연산 비용으로 약 25% 향상된 학습 효율을 달성했다. 이 모델은 장기적인 에이전트 코딩 및 자기 진화 워크플로우를 위해 설계되었으며, 최소한의 인간 개입으로도 긴 엔지니어링 세션을 지속할 수 있다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 @cyrilXBT: 2.8 trillion parameters. 1 million token context. Native multimodal. Kimi Delta Attention delivers up to 6.3x faster decoding at m
원문 보기 ↗