Transformer 아키텍처
Transformer가 왜 대규모 모델의 기본 구조가 되었는지, 어텐션의 비용은 어디에 있는지, 확산 언어 모델과 단일 스트림 구조가 무엇을 바꾸려 하는지 정리합니다.
Transformer가 대규모 모델의 기본 구조가 된 이유는 어텐션이 임의의 두 위치를 직접 잇고 학습을 병렬화하기 쉽기 때문입니다. 비용도 분명해 계산량이 시퀀스 길이의 제곱으로 늘어 긴 문맥이 비싸집니다. 확산 언어 모델과 단일 스트림 확산은 한 토큰씩 생성하는 비효율을 없애거나 텍스트와 이미지를 하나의 생성 경로로 묶으려 합니다. 이 태그는 그 절충과 구조 변경이 이득이 되는 지점을 정리합니다.