ToolNavs 发现实用AI工具
提交工具 登录
返回AI百科
扩散模型是什么?图片生成为什么先把画面打乱再慢慢还原

扩散模型是什么?图片生成为什么先把画面打乱再慢慢还原

AI百科 • Admin • • 8 次浏览

扩散模型是一种通过先向数据逐步加入噪声、再学习如何逐步去除噪声来生成新内容的生成模型,是当前图片生成的主流方法之一。它不直接画出一张图,而是从一片纯噪声出发,一步步清掉噪声,让画面慢慢显形。

先加噪,再去噪:两个相反的过程

前向过程是加噪:拿一张真实图片,按固定步骤一层层掺入随机噪声,经过多步之后,图片变成完全看不出原样的噪声。这个过程不需要学习,只是按规则把画面打乱。

反向过程是去噪,也是生成时用的方向。模型从一团随机噪声开始,预测并去掉一部分噪声,得到稍清晰的结果,再继续迭代,直到生成一张完整的新图片。生成时的起点是随机噪声,不是某一张现成图片。

训练时学的是预测噪声

训练时并不是让模型背下图片,而是让它练习预测噪声:看到一张被加噪的图片和加噪步数,能准确猜出其中掺入的噪声是什么。同一张图会被加噪到不同程度,让模型反复练习。

学会预测噪声,去噪就有了依据。每一步把预测出的噪声减掉一部分,画面就向真实数据的样子靠近一点。模型学到的是数据的分布规律,所以能生成训练集中从未出现过的新组合,而不是复制原图。

步数决定速度,也影响质量

扩散模型的生成是迭代式的,一步只改一点,通常需要几十步才能完成一张图。步数越多,每一步改动越小,画面往往越稳定、细节越干净,但耗时更长;步数太少,改动跨度太大,容易出现结构扭曲、细节模糊。

这也是它的明显短板:比起一次成型的生成方式,速度天然偏慢。后续的加速采样和蒸馏技术,核心都是在尽量少丢质量的前提下,把需要的步数压下来。

和 GAN、自回归生成差在哪

GAN 靠生成器和判别器对抗训练,一次输出完整结果,速度快,但训练不稳定,多样性有时不足。自回归生成则像写句子一样,一个像素或一个小块接一个小块顺序生成,逻辑清晰但容易累积误差。

扩散模型训练相对稳定,生成结果多样、细节可控。它用多步迭代换来质量和稳定性,代价是推理速度。三类方法没有绝对的替代关系,更多是取舍不同。

两个最常见的误解

第一个误解是以为扩散模型是把一张现成图片弄模糊再还原。加噪再去噪只是训练时构造学习任务的方式;真正生成时,输入只有随机噪声和文字提示等条件,没有原图可还原,输出是全新的图片。

第二个误解是以为它生成时在改某张底图。只有图生图这类专门模式,才是用户主动提供底图并控制改动幅度,那和文生图的默认生成过程不是一回事。

Stable Diffusion 是扩散模型最有代表性的应用之一,它采用潜空间扩散:先把图片压缩到更小的潜空间,在那里完成加噪和去噪,最后再解码回图片。计算量因此大幅下降,普通显卡也能运行。

推荐工具

更多