返回文章列表

模型架构

找到 4 篇相关文章

混合专家(MoE)是什么?为什么很多热门模型参数很大、激活却没那么大

混合专家(MoE)是什么?为什么很多热门模型参数很大、激活却没那么大

混合专家(MoE,Mixture of Experts)是一种“不是每次都让整套模型一起上”的模型架构。它最关键的特点,是把模型里的某些层拆成多个专家模块,再由一个路由器决定当前 token 该走哪些专家。这样模型总参数可以做得很大,但一次真正参与计算的参数没那么大,所以你才会看到很多热门模型写着几...

AI百科 Admin
68
稀疏注意力(Sparse Attention)是什么?为什么长上下文和推理成本问题总会谈到它

稀疏注意力(Sparse Attention)是什么?为什么长上下文和推理成本问题总会谈到它

稀疏注意力可以简单理解成:不是让每个 token 都去看所有 token,而是有选择地只看其中一部分。这个词会反复出现在长上下文和推理成本讨论里,是因为标准全注意力虽然强,但一旦上下文特别长,计算和显存成本就会涨得很快。 为什么“全看一遍”会越来越贵 在标准注意力里,文本越长,彼此之间需要计算的关系...

AI百科 Admin
83
Transformer 是什么?为什么大模型几乎都建立在它上面

Transformer 是什么?为什么大模型几乎都建立在它上面

Transformer 是一种神经网络架构。它之所以重要,不是因为名字响,而是因为它把“并行处理”和“上下文建模”这两件事做得很好。今天你看到的大多数大语言模型,本质上都离不开它或它的变体。 在 Transformer 之前,很多模型更依赖循环结构,一步一步读文本,速度慢,长距离依赖也容易掉链子。T...

AI百科 Admin
92

推荐工具

更多