Architecture Transformer
Pourquoi le Transformer est devenu le socle par défaut des grands modèles, ce que coûte réellement l'attention, et ce que tentent de changer les modèles de diffusion et les architectures à flux unique.
Le Transformer s'est imposé parce que l'attention relie directement deux positions quelconques et que l'entraînement se parallélise bien. Le coût est net : le calcul croît avec le carré de la longueur de séquence, ce qui rend le contexte long cher. Les modèles de diffusion et les architectures à flux unique s'attaquent à l'inefficacité de la génération jeton par jeton, ou unifient texte et image dans un seul chemin. Ce tag détaille ces arbitrages et quand un changement d'architecture paie.