주의 메커니즘은 단순히 모델이 정보를 처리할 때 "핵심 지점을 보는 법"을 학습한다는 의미입니다. 사람이 단락을 읽을 때 각 단어를 똑같이 바라보지 않으며, 모델도 동일합니다: 과제에 따라 단어나 조각에 다른 가중치를 부여합니다. 가중치가 높은 콘텐츠는 결과에 더 큰 영향을 미치고, 낮은 가중치의 콘텐츠는 배경 소음과 같습니다.
이 때문에 주의 메커니즘이 나타나면 대형 모델의 효과가 크게 변하는 것입니다. 이전 모델은 순서대로 읽는 엄격한 독서였고, 뒷면을 읽을 때 앞면을 자주 잊어버렸습니다; 주의 메커니즘을 통해 모델은 현재 단계에서 더 관련 있는 정보를 찾기 위해 다시 돌아갈 수 있어, 긴 문장, 문장 간 관계, 맥락적 이해가 훨씬 더 좋아집니다.
도대체 이게 뭐 하는 거야
주의력 메커니즘을 "상관관계 점수표"라고 생각할 수 있습니다. 단어를 생성하기 전에 모델은 입력 내 현재 과제와 가장 관련 있는 단어를 결정하고, 그 단어들의 효과를 증폭시킵니다. 여기서 핵심은 '모든 것을 기억하는 것'이 아니라, '매 단계마다 누구를 참고해야 할지 아는 것'입니다.
따라서 주의 메커니즘은 저장 문제를 해결하지 못하고 검색 문제를 해결합니다. 이 모델은 인간처럼 전체 텍스트를 이해하는 것이 아니라, 방대한 정보 속에서 현재 정보의 가장 유용한 부분을 찾는 데 더 능숙합니다. 번역, 요약, 질의응답, 코드 이해 측면에서 그 역할은 명확합니다. 긴 문서를 요약할 때, 모델은 제목, 법인, 관계를 파악할 수 있으며, 이것도 마찬가지입니다.
실제 모델에서는 주의 메커니즘이 보통 단독으로 작동하지 않고, 위치 부호화, 피드포워드 네트워크, 잔류 연결과 같은 모듈과 협력하여 완전한 아키텍처를 형성합니다.
가장 흔한 오해
- 오해 1: 주의는 생각과 같다. 사실, 이것은 가중치가 부여된 선택 메커니즘일 뿐입니다.
- 오해 2: 관심이 많을수록 더 강해져야 한다. 실제로는 학습 데이터, 매개변수 규모, 구조 설계에도 달려 있습니다.
- 오해 3: 주의력은 모든 맥락을 완벽하게 기억한다. 긴 텍스트가 많아도 모델은 컨텍스트 창과 노이즈의 영향을 받습니다.
진짜 중요한 것은 주의 메커니즘이 모델을 '기계적 순차 읽기'에서 '동적 키 읽기'로 전환할 수 있게 해준다는 점입니다. 이것이 이후 대형 모델 하단의 거의 표준 구성이 된 이유이기도 합니다.