희소주의는 간단히 이해할 수 있습니다: 각 토큰이 모든 토큰을 살펴보는 대신, 선택적으로 일부만 살펴보게 하는 것입니다. 이 용어는 긴 맥락과 추론 비용 논의에서 반복적으로 등장하는데, 표준 전면 집중이 강하지만, 맥락이 특히 길어지면 계산과 비디오 메모리 비용이 급격히 증가하기 때문입니다.
왜 '전부 읽기'가 점점 더 비싸지는 걸까요?
표준 주의에서는 텍스트가 길수록 서로 간의 관계 계산이 더 많아집니다. 짧은 텍스트라면 괜찮지만, 긴 문서, 긴 코드, 여러 차례의 역사가 쌓이면 자원에 대한 압박이 빠르게 증가합니다. 스페르스 주의의 개념은: 모든 포지션이 똑같이 중요하지 않으니 모두 세지 말라는 것입니다.
보통 얼마나 드문드문한지요
- 지역 이웃만 보고 최근 맥락을 유지하세요.
- 제목, 앵커, 요약 등 소수의 주요 위치에 전 세계 가시성을 부여하세요.
- 규칙이나 배운 패턴을 따라 더 주목할 만한 구간을 선택하세요.
왜 이 개념이 점점 뜨거워지고 있는지
- 긴 맥락은 '실험적 판매 포인트'에서 실제 제품 수요로 바뀌었습니다.
- 모델이 크고 맥락이 길수록 추론 비용은 더 신중해집니다.
- 추론 모델과 에이전트 작업이 링크를 더 길게 만들 가능성이 높으며, 아키텍처 계층 최적화는 더욱 중요합니다.
하지만 드문드문 주의는 헛되지 않습니다. 어떤 콘텐츠를 놓치면 장거리 의존성이나 숨겨진 연관성을 놓칠 수 있습니다. 따라서 핵심은 '드문드문일수록 좋다'가 아니라, 중요한 정보를 유지하고 비용을 어떻게 균형 있게 조절할지에 관한 것입니다. 바로 이 긴장 때문에 긴 맥락이 뜨거워지면 드문드문 주의가 다시 뜨거워진다.