ToolNavs 发现实用AI工具
提交工具 登录

Transformer 架构

解释 Transformer 为何成为大模型的默认骨架,注意力机制的代价在哪,以及扩散语言模型、单流结构等新路线试图改掉什么。

Transformer 之所以成为大模型的默认骨架,靠的是注意力机制能把任意两个位置直接连起来,训练也容易并行。代价同样清楚:计算量随序列长度平方增长,长上下文因此变贵。扩散语言模型与单流扩散结构,则是在试着改掉自回归逐词生成的效率问题,或把文本与图像统一到一条生成链路上。本标签拆解这些取舍。