스파스 어텐션
스파스 어텐션의 원리와 주요 구현, 트레이드오프를 설명합니다. 핵심 토큰에만 연산을 집중해 긴 컨텍스트의 계산 비용과 메모리를 줄이는 방법을 다룹니다.
스파스 어텐션은 긴 컨텍스트에서도 대규모 언어 모델을 효율적으로 동작시키는 핵심 기술입니다. 모든 토큰에 대한 어텐션 연산을 중단하고 블록 선택, 토큰 선택, KV 공유 등으로 연산 자원을 중요한 위치에 집중합니다. 이 특집에서는 원리의 변천, HySparse 등 대표 아키텍처, 에이전트 장기 작업과 백만 토큰 추론에서의 실제 장단점을 살피며 도입 판단의 근거를 제공합니다.