Agentic Relations

Attention is All You Need (2017 Paper)

NeurIPS-Publikation von Vaswani et al. (2017), die die Transformer-Architektur einführte und damit die Grundlage praktisch aller modernen Sprachmodelle legte.

Definition

Attention Is All You Need ist eine wissenschaftliche Publikation, die von acht Forschern bei Google Brain und Google Research im Juni 2017 auf arXiv veröffentlicht und im Dezember 2017 auf der NeurIPS-Konferenz vorgestellt wurde. Sie führt die Transformer-Architektur ein, die ausschliesslich auf dem Attention-Mechanismus basiert und Rekurrenz sowie Faltung vollständig eliminiert. Die Publikation gilt als eines der einflussreichsten KI-Papers überhaupt und ist die direkte Grundlage praktisch aller modernen Sprachmodelle.

Die Publikation ist mit 15 Seiten vergleichsweise kompakt und folgt einer klaren Struktur: Motivation (RNN-Limitationen), Architektur (Encoder-Decoder mit Self-Attention), experimentelle Ergebnisse (WMT-Benchmarks), Ablations-Studien und Diskussion. Diese Kompaktheit kontrastiert mit der historischen Tragweite und ist Teil der Popularität in Lehre und Forschung.

Geschichte

Vor 2017

Vor dem Transformer dominierten rekurrente Netze (RNN, LSTM, GRU) und konvolutionale Sequenz-Modelle in der NLP-Forschung. Diese Architekturen verarbeiten Sequenzen Token für Token, was Parallelisierung verhindert und Long-Range-Dependencies erschwert. Der Attention-Mechanismus war bereits 2014 bei Bahdanau et al. als Ergänzung zu Encoder-Decoder-RNNs eingeführt worden, blieb aber an die rekurrente Verarbeitung gebunden.

Die Publikation

Im Juni 2017 veröffentlichten Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser und Illia Polosukhin die arXiv-Preprint Attention Is All You Need. Die Hauptthese: Attention allein reicht aus, Rekurrenz und Faltung sind nicht notwendig. Die experimentelle Validierung erfolgte auf den WMT-2014-Benchmarks für Englisch-Deutsch und Englisch-Französisch.

Die Ergebnisse: 28.4 BLEU auf En-De und 41.8 BLEU auf En-Fr, jeweils Rekord. Dramatischer war die Trainings-Effizienz: das Modell trainierte in 3.5 Tagen auf 8 GPUs, gegenüber Wochen für vergleichbare LSTM-Baselines. Diese Effizienz war der Hebel, der späteres Scaling auf hunderte und tausende GPUs überhaupt erst praktikabel machte.

NeurIPS 2017

Die Konferenz NeurIPS 2017 fand vom 4. bis 9. Dezember in Long Beach, Kalifornien statt. Die Transformer-Publikation war eine von etwa 700 angenommenen Papers, erhielt keine besondere Auszeichnung und wurde zunächst als interessante aber nicht herausragende Architektur-Variante gesehen. Erst die anschliessenden BERT-Resultate (Oktober 2018) und GPT-Resultate (Juni 2018) machten die historische Bedeutung sichtbar.

Architektur und Konzepte

Die Publikation führt mehrere zentrale Konzepte ein:

  • Self-Attention: jedes Token in einer Sequenz berechnet Attention zu allen anderen Tokens, was Long-Range-Dependencies direkt überbrückt.
  • Scaled Dot-Product Attention: Attention-Scores via Dot-Product zwischen Query und Key, skaliert durch Wurzel der Dimension.
  • Multi-Head Attention: mehrere parallele Attention-Köpfe (im Paper 8), die je eigene Repräsentationen lernen.
  • Positional Encoding: sinusoidale Funktionen ergänzen Position-Information, da Self-Attention permutationsinvariant ist.
  • Encoder-Decoder-Stack: je 6 identische Schichten mit Self-Attention, Feed-Forward und Layer Normalization.
  • Residual Connections: Skip-Pfade ermöglichen Gradientenfluss in tiefen Netzen.

Diese Komponenten sind die Bausteine, aus denen heute Modelle wie GPT-4, Claude, Gemini und Llama gebaut sind.

Bedeutung und Wirkung

Die Publikation hat KI fundamental verändert. Innerhalb von Monaten wurde die Architektur breit übernommen:

  • 2018 BERT: Encoder-only-Transformer setzt neue Standards in NLU.
  • 2018 GPT-1: Decoder-only-Transformer demonstriert generatives Pretraining.
  • 2019 GPT-2: zeigt erstmals breit kohärente Text-Generierung.
  • 2020 GPT-3: Skalierung auf 175B Parameter, Few-Shot-Learning.
  • 2020-2026: Transformer wird Standard-Architektur für NLP, Vision (ViT), Audio (Whisper), Code (Codex), Robotik und Multi-Modalität.

Bis 2026 hat die Publikation über 200000 Zitationen erreicht und gehört zu den meistzitierten KI-Publikationen überhaupt. Sie wird in praktisch jedem NLP- und Machine-Learning-Kurs an Universitäten gelesen und ist Pflichtlektüre für KI-Forschung.

Mehrere Autoren haben einflussreiche KI-Unternehmen gegründet:

  • Aidan Gomez: Cohere, eines der führenden kanadischen LLM-Unternehmen mit Sitz in Toronto.
  • Illia Polosukhin: NEAR Protocol, Blockchain-KI-Schnittstelle.
  • Noam Shazeer: Character.AI (zurück zu Google für Gemini), Pionier konversationeller KI.
  • Ashish Vaswani und Niki Parmar: Essential AI, Frontier-Modell-Startup.
  • Jakob Uszkoreit: Inceptive, KI für RNA und Biologie.

Häufige Fehler

  • Attention isolated betrachten: Attention war 2014 bei Bahdanau bereits eingeführt; neu ist die Eliminierung der Rekurrenz.
  • Original-Architektur als Standard nehmen: moderne LLMs haben Pre-LayerNorm, Rotary Position Embeddings, SwiGLU statt der Original-Komponenten.
  • Encoder-Decoder-Symmetrie übergeneralisieren: moderne LLMs sind primär Decoder-only, Encoder-Decoder ist Nische.
  • Sinusoidale Positional Encodings als best practice: RoPE und ALiBi sind heute überlegen für lange Kontexte.
  • Multi-Head Attention überbewerten: neuere Forschung zeigt, dass viele Köpfe redundant sind und gepruned werden können.

Abgrenzung

  • Bahdanau et al. (2014): ursprüngliche Einführung von Attention, aber gekoppelt an RNNs.
  • Convolutional Sequence Models (Gehring et al. 2017): Alternative zur Rekurrenz, vom Transformer abgelöst.
  • RNN, LSTM, GRU: Vorgänger-Architekturen, weitgehend verdrängt.
  • State-Space-Modelle (Mamba, RWKV): alternative Architektur mit linearer Komplexität, marginale Verbreitung im Frontier-Bereich.
  • Hyena, RetNet: experimentelle Architekturen mit eingeschränkter Adoption.

Weiter im KI-Lexikon

← Zurück zum Lexikon

Häufige Fragen

Was ist die Publikation Attention is All You Need?+

Attention Is All You Need ist eine wissenschaftliche Publikation, die von acht Forschern bei Google Brain und Google Research im Juni 2017 auf arXiv veröffentlicht und im Dezember 2017 auf der NeurIPS-Konferenz vorgestellt wurde. Sie führt die Transformer-Architektur ein, die ausschliesslich auf dem Attention-Mechanismus basiert und Rekurrenz sowie Faltung vollständig eliminiert.

Wer sind die Autoren?+

Die acht Autoren sind Ashish Vaswani, Noam Shazeer, Niki Parmar, Jakob Uszkoreit, Llion Jones, Aidan Gomez, Lukasz Kaiser und Illia Polosukhin. Viele sind später Mitgründer einflussreicher KI-Startups geworden: Vaswani gründete Essential AI, Shazeer Character.AI und später Google Gemini-Lead, Parmar Essential AI, Gomez Cohere, Polosukhin NEAR Protocol.

Was war das ursprüngliche Anwendungsziel?+

Die Publikation präsentierte den Transformer ursprünglich als Architektur für maschinelle Übersetzung. Die Benchmark war WMT 2014 English-to-German und English-to-French. Der Transformer erreichte 28.4 BLEU auf En-De und 41.8 BLEU auf En-Fr, deutlich besser als bisherige Encoder-Decoder-LSTMs und Convolutional Sequence Models, bei dramatisch reduzierten Trainingskosten.

Warum war die Publikation revolutionär?+

Drei Gründe: erstens eliminiert die Architektur Rekurrenz vollständig und erlaubt damit massive Parallelisierung auf GPUs und TPUs. Zweitens überbrückt Self-Attention beliebige Distanzen direkt, was Long-Range-Dependencies löst. Drittens skaliert die Architektur empirisch enorm gut mit Daten und Compute, was die Grundlage für die LLM-Welle 2018 ff. wurde.

Welche Komponenten führt die Publikation ein?+

Die zentralen Komponenten sind Multi-Head Self-Attention, Skalierte Dot-Product-Attention, Positional Encodings (sinusoidal), Position-wise Feed-Forward Networks, Layer Normalization und Residual Connections. Die Encoder-Decoder-Struktur ist symmetrisch mit gestapelten identischen Schichten, klassischer Transformer hatte 6 Encoder- und 6 Decoder-Schichten.

Wie wurde die Publikation aufgenommen?+

Die Aufnahme war schnell und massiv. Bereits 2018 wurde der Transformer Grundlage von BERT (Encoder-only) und GPT (Decoder-only). Bis 2026 hat die Publikation über 200000 Zitationen erreicht und gehört zu den meistzitierten KI-Publikationen überhaupt. Die Hugging Face Transformers Library, benannt nach der Architektur, ist Standard-Werkzeug in der NLP-Forschung.

Was war die Konferenz NeurIPS 2017?+

NeurIPS 2017 fand vom 4. bis 9. Dezember in Long Beach, Kalifornien statt. Die Transformer-Publikation war eine von etwa 700 angenommenen Papers, erhielt keine besondere Auszeichnung und galt zunächst als interessante aber nicht herausragende Architektur-Variante. Erst die anschliessenden BERT- und GPT-Resultate machten die historische Bedeutung sichtbar.

Welche Begriffe wurden geprägt?+

Die Publikation prägte oder popularisierte zentrale Begriffe: Transformer (Architektur), Multi-Head Attention, Scaled Dot-Product Attention, Positional Encoding (sinusoidal), Query-Key-Value-Triplett, Encoder-Decoder Stack, Self-Attention. Diese Terminologie ist 2026 Standard-Vokabular in jeder NLP-Diskussion.

Verwandte Begriffe

Quellen

  • Vaswani et al. (2017) Attention Is All You Need (NeurIPS 2017)
  • Google Brain Research Blog (2017)
  • NeurIPS Proceedings Archive
  • Annotated Transformer (Harvard NLP)

Wikidata: Q30249683 · Zuletzt geprüft: 2026-07-02