返回AI百科
Diffusion LLM 是什么?为什么它总被拿来挑战 Transformer 的自回归路线

Diffusion LLM 是什么?为什么它总被拿来挑战 Transformer 的自回归路线

AI百科 Admin 95 次浏览

Diffusion LLM 可以理解成把“扩散模型”的一些核心思路搬到语言模型里,用逐步去噪、逐步修正的方式生成文本,而不是像传统自回归模型那样一个 token 一个 token 往后写。它最近常被提起,不是因为已经全面取代 Transformer 路线,而是因为行业一直在找别的文本生成范式,看看能不能在速度、并行性或控制性上打开新空间。

它和自回归语言模型最不一样的地方

自回归模型更像从左到右写句子,后一个词依赖前一个词;Diffusion LLM 更像先给你一团粗糙结果,再一轮轮把它修清楚。也正因为如此,它理论上更容易并行生成,但同时也会遇到语言离散结构更难处理的问题。

路线直观理解潜在优势主要难点
自回归一个词接一个词写成熟、稳定、生态强长输出时串行成本高
Diffusion LLM先粗后细反复修并行潜力、全局调整空间语言离散性和训练难度更高

为什么这个词最近又热起来

  • 图像和视频领域的扩散路线已经很成功,大家自然会问文本能不能也走这条路。
  • 推理成本、长输出效率和更强控制性,都是自回归路线之外的真实研发动机。
  • 当大模型竞争进入架构深水区,任何可能改写生成方式的方向都会重新升温。

但现在更合理的看法是:Diffusion LLM 还是一个值得关注的探索方向,而不是已经坐稳主流。它解释了一个行业层面的信号:语言模型并不是只有自回归这一条路,哪怕主路线还没变,替代路线也在加速试探。

推荐工具

更多