← promppy_ 실시간 AI 뉴스
참고X

Kimi, 'Delta Attention' 공개…디코딩 속도 6.3배 향상 및 KV 캐시 최적화

추론 효율성을 극대화한 신규 아키텍처. 장기 문맥 처리가 필요한 엔지니어링 워크플로우라면 참고할 가치가 있음.

요약

Kimi가 2.8조 개의 파라미터와 100만 토큰의 컨텍스트 윈도우를 지원하는 네이티브 멀티모달 모델을 발표했다. 핵심 기술인 Kimi Delta Attention은 100만 토큰 컨텍스트 환경에서 디코딩 속도를 최대 6.3배 높이고 KV 캐시 메모리 사용량을 최대 75%까지 절감한다. 또한 Attention Residuals 기술을 도입해 2% 미만의 추가 연산 비용으로 약 25% 향상된 학습 효율을 달성했다. 이 모델은 장기적인 에이전트 코딩 및 자기 진화 워크플로우를 위해 설계되었으며, 최소한의 인간 개입으로도 긴 엔지니어링 세션을 지속할 수 있다.

AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.

원문 제목 @cyrilXBT: 2.8 trillion parameters. 1 million token context. Native multimodal. Kimi Delta Attention delivers up to 6.3x faster decoding at m

원문 보기 ↗
다음 뉴스 →

중요Codex·ChatGPT Work, 글로벌 장애 복구 후 사용량 제한 초기화

새벽 장애로 한도 리셋. Codex 쓰는 팀은 오늘 사용량 여유 생겼으니 참고.

promppy는 한국 AI 실무자를 위한 실시간 AI 뉴스 터미널입니다.

15분마다 속보·중요·팁 자동 수집 · 한국어 요약 제공

실시간 피드 보기 →RSS 구독

관련 뉴스

최신 뉴스