참고Reddit
Agnes-3.0-Flash 33B 모델 공개: 하이브리드 어텐션 적용
33B 규모에 262k 컨텍스트, 하이브리드 어텐션 아키텍처를 도입해 성능과 효율을 최적화한 모델. 로컬 LLM 환경에서 평가 가치 높음.
요약
최근 r/LocalLLaMA에서 주목받는 Agnes-3.0-Flash 33B Multimodal 모델이 공개되었으며, AA 벤치마크 점수 36을 기록했다. 이 모델은 262,144 토큰의 긴 컨텍스트 윈도우를 지원하며 텍스트, 이미지, 비디오를 모두 이해하는 멀티모달 기능을 갖췄다. 아키텍처는 하이브리드 어텐션 디코더 방식을 채택해 72개 층 중 54개 층은 gated delta rule(재귀적 방식)을, 나머지 18개 층은 표준 글로벌 어텐션을 수행한다. 이러한 구조 덕분에 전체 층 중 4분의 1만 컨텍스트 길이에 비례해 증가하는 KV 캐시를 보유하여 효율적인 연산이 가능하다. 또한 조정 가능한 추론 노력(reasoning effort)과 툴 콜링 기능을 제공하여 복잡한 실무 작업에 최적화되었다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Agnes-AI/Agnes-3.0-Flash 33B Multimodal, AA score: 36
원문 보기 ↗