SchlüsselarbeitOriginalarbeiterreichbar
Neural Machine Translation by Jointly Learning to Align and Translate
Bahdanau, Cho und Bengio reichen am 01.09.2014 die Arbeit ein, in der der Mechanismus der Aufmerksamkeit seine Form bekommt. Die damals übliche Bauform presste den ganzen Ausgangssatz in einen Vektor fester Länge; die Arbeit vermutet darin den Engpass und lässt das Modell bei jedem Zielwort selbst suchen, welche Stellen der Eingabe dafür zählen. Im Kurztext heißt der Mechanismus weiches Suchen, das Wort Aufmerksamkeit setzte sich erst später durch. Drei Jahre vor dem Transformer, der allein darauf aufbaut.
geprüft 24.09.2026
Worauf sich diese Seite beruft, wörtlich, abgerufen am 07.08.2026:
we conjecture that the use of a fixed-length vector is a bottleneck in improving the performance of this basic encoder-decoder architecture
bestätigt 24.09.2026allowing a model to automatically (soft-)search for parts of a source sentence that are relevant to predicting a target word
bestätigt 24.09.2026