Transformer 是什么?为什么大模型几乎都建立在它上面
Transformer 是一种神经网络架构。它之所以重要,不是因为名字响,而是因为它把“并行处理”和“上下文建模”这两件事做得很好。今天你看到的大多数大语言模型,本质上都离不开它或它的变体。 在 Transformer 之前,很多模型更依赖循环结构,一步一步读文本,速度慢,长距离依赖也容易掉链子。T...
AI百科 • Admin •
92
找到 2 篇相关文章
Transformer 是一种神经网络架构。它之所以重要,不是因为名字响,而是因为它把“并行处理”和“上下文建模”这两件事做得很好。今天你看到的大多数大语言模型,本质上都离不开它或它的变体。 在 Transformer 之前,很多模型更依赖循环结构,一步一步读文本,速度慢,长距离依赖也容易掉链子。T...
注意力机制,简单说就是让模型在处理信息时学会“看重点”。人读一段话时不会平均看每个字,模型也一样:它会根据当前任务,给不同词或片段分配不同权重。权重高的内容更容易影响结果,权重低的内容就像背景噪音。 这也是为什么注意力机制一出现,大模型的效果就明显变了。以前的模型更像按顺序硬读,读到后面经常忘前面;...