Transformer-Architektur
Warum der Transformer zum Standardgerüst großer Modelle wurde, was Aufmerksamkeit tatsächlich kostet und was neuere Wege wie Diffusions-Sprachmodelle oder Single-Stream-Designs ändern wollen.
Der Transformer wurde zum Standardgerüst, weil Aufmerksamkeit je zwei Positionen direkt verbindet und sich das Training gut parallelisieren lässt. Der Preis ist klar: Der Rechenaufwand wächst quadratisch mit der Sequenzlänge, langer Kontext wird teuer. Neuere Entwürfe wie Diffusions-Sprachmodelle greifen die Ineffizienz des tokenweisen Erzeugens an oder führen Text und Bilder in einem Pfad zusammen. Dieser Tag ordnet diese Abwägungen ein.