참고Reddit
논문: LLM이 스스로 어텐션 영역을 제어하는 'Declarative Attention'
모델이 추론 과정 중 필요한 컨텍스트를 직접 선별하게 하여, 전체 컨텍스트 탐색 비용을 줄이는 새로운 접근 방식.
요약
언어 모델이 전체 KV 캐시를 탐색하지 않고도 문맥 내 중요 정보를 스스로 선택하여 어텐션(Attention)을 제어할 수 있는 'Declarative Attention(DA)' 기법이 공개되었습니다. 기존 방식은 경량 프록시 점수를 통해 관련 토큰을 사전 선택하지만, 여전히 단계별로 O(N)의 비용이 발생한다는 한계가 있습니다. DA는 모델이 사고 과정(Chain-of-Thought) 속에서 필요한 정보를 직접 선언하도록 유도하여 세 단계로 생성을 분할하는 내재적 접근 방식을 취합니다. 이를 통해 모델은 전체 문맥을 스캔할 필요 없이 필요한 정보에만 효율적으로 집중할 수 있게 됩니다. 연구진은 이 프로토콜이 100만 토큰 규모의 긴 대화에서도 어텐션 효율성을 개선할 수 있음을 시사합니다.
AI가 원문을 요약한 내용으로, 부정확할 수 있습니다.
원문 제목 Language Models Can Control Their Own Attention [R]
원문 보기 ↗