Diffusion LLM 可以理解成把“扩散模型”的一些核心思路搬到语言模型里,用逐步去噪、逐步修正的方式生成文本,而不是像传统自回归模型那样一个 token 一个 token 往后写。它最近常被提起,不是因为已经全面取代 Transformer 路线,而是因为行业一直在找别的文本生成范式,看看能不能在速度、并行性或控制性上打开新空间。
它和自回归语言模型最不一样的地方
自回归模型更像从左到右写句子,后一个词依赖前一个词;Diffusion LLM 更像先给你一团粗糙结果,再一轮轮把它修清楚。也正因为如此,它理论上更容易并行生成,但同时也会遇到语言离散结构更难处理的问题。
| 路线 | 直观理解 | 潜在优势 | 主要难点 |
|---|---|---|---|
| 自回归 | 一个词接一个词写 | 成熟、稳定、生态强 | 长输出时串行成本高 |
| Diffusion LLM | 先粗后细反复修 | 并行潜力、全局调整空间 | 语言离散性和训练难度更高 |
为什么这个词最近又热起来
- 图像和视频领域的扩散路线已经很成功,大家自然会问文本能不能也走这条路。
- 推理成本、长输出效率和更强控制性,都是自回归路线之外的真实研发动机。
- 当大模型竞争进入架构深水区,任何可能改写生成方式的方向都会重新升温。
但现在更合理的看法是:Diffusion LLM 还是一个值得关注的探索方向,而不是已经坐稳主流。它解释了一个行业层面的信号:语言模型并不是只有自回归这一条路,哪怕主路线还没变,替代路线也在加速试探。