ToolNavs Outils IA à découvrir
Proposer Connexion
Retour à Encyclopédie de l’IA
Qu'est-ce qu'un modèle de diffusion ? Pourquoi la génération d'images brouille d'abord l'image avant de la restaurer lentement

Qu'est-ce qu'un modèle de diffusion ? Pourquoi la génération d'images brouille d'abord l'image avant de la restaurer lentement

Encyclopédie de l’IA • Admin • • 6 vues

Un modèle de diffusion est un modèle génératif qui crée de nouveaux contenus en ajoutant d'abord progressivement du bruit aux données, puis en apprenant à retirer progressivement ce bruit, et c'est aujourd'hui l'une des méthodes dominantes de génération d'images. Il ne dessine pas directement une image. Il part plutôt d'un bruit pur et élimine le bruit pas à pas, laissant l'image prendre forme lentement.

D'abord ajouter du bruit, puis le retirer : deux processus opposés

Le processus direct ajoute du bruit : il prend une image réelle et y mélange du bruit aléatoire couche par couche, selon des étapes fixes, jusqu'à ce qu'après de nombreuses étapes l'image devienne un bruit où l'original est totalement méconnaissable. Ce processus ne nécessite aucun apprentissage ; il brouille simplement l'image selon une règle.

Le processus inverse retire le bruit, et c'est la direction utilisée lors de la génération. Le modèle part d'une masse de bruit aléatoire, prédit et retire une partie du bruit pour obtenir un résultat légèrement plus net, puis continue d'itérer jusqu'à produire une image nouvelle et complète. La génération part d'un bruit aléatoire, et non d'une image existante.

Ce que l'entraînement apprend vraiment, c'est à prédire le bruit

L'entraînement ne consiste pas à faire mémoriser des images au modèle. Il lui fait plutôt pratiquer la prédiction du bruit : face à une image bruitée et à l'étape de bruitage, il doit deviner avec précision quel bruit y a été mélangé. La même image est bruitée à des degrés différents pour que le modèle s'exerce à répétition.

Une fois capable de prédire le bruit, le débruitage dispose d'une base. À chaque étape, retirer une partie du bruit prédit rapproche un peu l'image de l'apparence des données réelles. Ce que le modèle apprend, c'est la distribution des données elles-mêmes, de sorte qu'il peut générer de nouvelles combinaisons jamais apparues dans l'ensemble d'entraînement, au lieu de copier une image originale.

Le nombre d'étapes décide de la vitesse et influe aussi sur la qualité

La génération avec un modèle de diffusion est itérative : chaque étape ne change que peu de chose, et des dizaines d'étapes sont en général nécessaires pour achever une image. Plus il y a d'étapes, plus chaque changement est petit, et le résultat est souvent plus stable, avec des détails plus nets, mais cela prend plus de temps. Avec trop peu d'étapes, l'ampleur de chaque changement est trop grande, et les structures déformées et les détails flous apparaissent plus facilement.

C'est aussi sa faiblesse évidente : par rapport aux méthodes qui produisent un résultat en une seule passe, il est naturellement plus lent. Les techniques ultérieures d'échantillonnage accéléré et de distillation visent toutes, au fond, à réduire le nombre d'étapes nécessaires tout en perdant le moins de qualité possible.

La différence avec les GAN et la génération autorégressive

Un GAN repose sur l'entraînement antagoniste d'un générateur et d'un discriminateur. Il produit un résultat complet en une seule passe et il est rapide, mais son entraînement est instable et sa diversité parfois limitée. La génération autorégressive, elle, fonctionne comme l'écriture d'une phrase : elle génère un pixel ou un petit bloc après l'autre, dans l'ordre, ce qui est logiquement clair mais sujet à l'accumulation d'erreurs.

Un modèle de diffusion est relativement stable à entraîner, et ses résultats sont divers, avec des détails contrôlables. Il échange de multiples étapes itératives contre la qualité et la stabilité, au prix de la vitesse d'inférence. Les trois types de méthodes ne se remplacent pas de façon absolue ; ils relèvent surtout de compromis différents.

Deux malentendus les plus fréquents

Le premier malentendu consiste à croire qu'un modèle de diffusion rend floue une image existante puis la restaure. Ajouter du bruit puis le retirer n'est qu'une façon de construire une tâche d'apprentissage pendant l'entraînement. Lors de la génération réelle, les entrées ne sont que du bruit aléatoire et des conditions comme une consigne textuelle ; il n'y a aucune image originale à restaurer, et le résultat est une image entièrement nouvelle.

Le second malentendu consiste à croire qu'il modifie une image de base pendant la génération. Ce n'est que dans un mode dédié comme l'image-à-image que l'utilisateur fournit activement une image de base et contrôle l'ampleur des changements, et ce n'est pas la même chose que le processus par défaut de génération texte-à-image.

Stable Diffusion est l'une des applications les plus représentatives des modèles de diffusion, et il utilise la diffusion latente : il compresse d'abord une image dans un espace latent plus petit, y effectue l'ajout et le retrait du bruit, puis la décode enfin en image. La quantité de calcul s'en trouve fortement réduite, de sorte qu'il peut aussi fonctionner sur des cartes graphiques ordinaires.

Outils Recommandés

Plus