Transformer アーキテクチャ
なぜ Transformer が大模型の標準的な骨組みになったのか、注意機構のコストはどこにあるのか、拡散言語モデルや単一ストリーム構造が何を変えようとしているのかを整理します。
Transformer が大模型の標準構造になった理由は、注意機構が任意の二位置を直接結び、学習を並列化しやすいからです。代償も明確で、計算量は系列長の二乗で増え、長い文脈が高くつきます。拡散言語モデルや単一ストリーム拡散は、一語ずつ生成する非効率の解消や、テキストと画像の生成経路の統一を狙っています。本タグはその取舍と、構造変更が本当に効く場面を整理します。