Agentic Relations

T5 (Text-to-Text Transfer Transformer)

Encoder-Decoder-Transformer von Google Research, der 2019 das Text-to-Text-Paradigma etablierte und alle NLP-Aufgaben als Sequence-to-Sequence-Probleme formuliert.

Definition

T5 (Text-to-Text Transfer Transformer) ist ein Encoder-Decoder-Transformer-Modell, das 2019 von Google Research veröffentlicht wurde. Es etablierte das Text-to-Text-Paradigma, in dem alle NLP-Aufgaben als Sequence-to-Sequence-Probleme formuliert werden: jede Aufgabe wird zu Text-Eingabe → Text-Ausgabe, unabhängig davon, ob es sich um Klassifikation, Übersetzung, Zusammenfassung oder Question Answering handelt.

Die Publikation Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer ist eine der umfangreichsten systematischen Untersuchungen zu Transfer Learning in NLP überhaupt. Sie umfasst etwa 50 Seiten und Hunderte von Ablation-Experimenten zur Optimierung von Architektur, Pretraining-Strategie und Datensatz.

Geschichte und Architektur

T5 wurde von Colin Raffel, Noam Shazeer, Adam Roberts und Kollegen bei Google Research entwickelt und im Oktober 2019 auf arXiv veröffentlicht. Architektonisch folgt T5 dem Original-Transformer von Vaswani et al. (2017), mit Encoder und Decoder als getrennten Stapeln. Im Unterschied zum Original-Transformer nutzt T5:

  • Span-Corruption-Pretraining: zusammenhängende Token-Sequenzen werden maskiert und mit Sentinel-Tokens markiert, das Modell muss die Spans rekonstruieren.
  • Relative Positional Embeddings: statt absoluter Positionen werden Distanzen zwischen Tokens kodiert.
  • C4-Datensatz: 750 Gigabyte gereinigter Common-Crawl-Text als primäre Pretraining-Quelle.
  • Vereinheitlichtes Task-Format: alle Tasks erhalten Text-Präfixe wie translate English to German oder summarize.

Die Familie umfasst T5-Small (60M), T5-Base (220M), T5-Large (770M), T5-3B und T5-11B. Während die kleinen Varianten heute auf Consumer-GPUs laufen, war T5-11B 2019 das grösste öffentlich verfügbare Encoder-Decoder-Modell.

Bedeutung und Weiterentwicklung

T5 hatte mehrere langfristige Auswirkungen auf die NLP-Forschung:

  • Vereinheitlichtes Task-Framework: das Text-to-Text-Paradigma wurde zur Standard-Sprache für Multi-Task-Learning.
  • Systematische Methodologie: die T5-Studie etablierte den Standard für Ablation-Experimente und Hyperparameter-Berichte.
  • C4 als Daten-Quelle: der gereinigte Common-Crawl-Datensatz wurde Grundlage vieler späterer LLMs.
  • Encoder-Decoder-Revival: T5 bewies, dass die Encoder-Decoder-Architektur trotz GPT-Dominanz weiter relevant ist.

Wichtige Weiterentwicklungen:

  • mT5 (2020): mehrsprachige Variante, trainiert auf mC4 in 101 Sprachen.
  • ByT5 (2021): Byte-Level-Tokenization, robust gegenüber Spelling und Morphologie.
  • T5 1.1 (2021): überarbeitete Pretraining-Methodik, ohne Supervised Fine-Tuning im Pretraining.
  • Flan-T5 (2022): Instruction Tuning auf über 1800 Tasks, drastisch verbesserte Zero-Shot-Performance.
  • UL2 und Flan-UL2 (2022): vereinheitlichtes Pretraining-Objektiv (Mixture of Denoisers).

Praxis und Anwendungen

T5 und besonders Flan-T5 sind in der Produktion weit verbreitet, vor allem dort, wo strukturierte Generierungs-Aufgaben mit klarem Input-Output-Schnitt gefordert sind:

  • Übersetzung: kommerzielle MT-Systeme und Open-Source-Pipelines.
  • Zusammenfassung: Nachrichtenartikel, Dokumente, Meeting-Protokolle.
  • Question Answering: Closed-Domain-QA über Knowledge Bases.
  • Schema-zu-Text: SQL-Ergebnisse zu natürlicher Sprache.
  • Text-zu-Schema: Information Extraction in strukturierte Formate.

Flan-T5 ist 2026 die meistgenutzte T5-Variante. Open-Source-Pipelines wie Hugging Face Transformers und LangChain bieten Flan-T5 als kostengünstige Alternative zu proprietären LLMs, besonders wenn Daten-Hoheit oder On-Premise-Deployment gefordert sind.

Häufige Fehler

  • T5 für offene Konversation einsetzen: T5 ist für strukturierte Tasks optimiert, für freie Chats sind GPT-ähnliche Decoder-only-Modelle besser.
  • Task-Präfixe vergessen: ohne den richtigen Präfix (translate, summarize) liefert T5 inkonsistente Ergebnisse.
  • Original T5 statt Flan-T5 nutzen: Flan-T5 hat dramatisch bessere Zero-Shot- und Few-Shot-Performance.
  • C4 ohne Sprachfilter verwenden: der originale C4 ist primär englisch, mehrsprachige Anwendungen brauchen mC4 oder mT5.
  • Sequence-Längen ignorieren: T5 hat typischerweise 512 Token Encoder und 512 Token Decoder, längere Inputs müssen gechunkt werden.

Abgrenzung

  • BERT: Encoder-only, optimiert für Verständnis, nicht für Generierung.
  • GPT-Familie: Decoder-only, optimiert für offene Generierung und Few-Shot-Prompting.
  • BART (Facebook): Encoder-Decoder mit anderem Pretraining-Objektiv, ähnliches Anwendungsspektrum.
  • PaLM, GPT-4, Claude: moderne LLMs, dominanter für allgemeine Sprach-Tasks, aber teurer und API-only.
  • mT5, Flan-T5, UL2: Weiterentwicklungen innerhalb der T5-Familie.

Weiter im KI-Lexikon

← Zurück zum Lexikon

Häufige Fragen

Was ist T5?+

T5 (Text-to-Text Transfer Transformer) ist ein Encoder-Decoder-Transformer-Modell, das 2019 von Google Research veröffentlicht wurde. Es etablierte das Text-to-Text-Paradigma, in dem alle NLP-Aufgaben (Klassifikation, Übersetzung, Zusammenfassung, Question Answering) als Sequence-to-Sequence-Probleme formuliert werden, mit Text als Eingabe und Text als Ausgabe.

Wer hat T5 entwickelt?+

T5 wurde von Colin Raffel und Kollegen bei Google Research entwickelt und in der umfangreichen Studie Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer (rund 50 Seiten) veröffentlicht. Die Publikation gehört zu den einflussreichsten systematischen Untersuchungen zu Transfer Learning in NLP.

Was ist das Text-to-Text-Paradigma?+

Statt task-spezifische Output-Köpfe (Klassifikator, Span-Predictor, Sequenz-Generator) zu trainieren, formuliert T5 jede Aufgabe als Text-Generierung. Eine Klassifikations-Aufgabe wird zur Frage Welche Klasse hat dieser Text und die Antwort ist die Klasse als Text. Übersetzung wird zur Text-Eingabe Übersetze ins Deutsche: Hello, Output Hallo. Diese Vereinheitlichung erlaubt einheitliches Training auf vielen Tasks.

Welche T5-Varianten gibt es?+

Die Original-T5-Familie umfasst Small (60M), Base (220M), Large (770M), 3B und 11B Parameter. Wichtige Weiterentwicklungen sind mT5 (mehrsprachig, 101 Sprachen), ByT5 (Byte-Level, keine Tokenization), T5 1.1 (überarbeitete Pretraining-Methodik) und Flan-T5 (Instruction Tuning auf mehr als 1800 Tasks). Flan-T5 ist 2026 die meistgenutzte T5-Variante in der Produktion.

Was war der C4-Datensatz?+

Colossal Clean Crawled Corpus (C4) ist ein 750-Gigabyte-Textkorpus, den Google für das T5-Pretraining aus Common Crawl extrahierte und intensiv reinigte. C4 wurde zum Standard-Datensatz für viele spätere LLM-Trainings, weil es offen verfügbar und gut dokumentiert ist. Es enthält etwa 365 Millionen Webdokumente in englischer Sprache.

Was ist Span-Corruption-Pretraining?+

Während BERT einzelne Tokens maskiert (MLM), maskiert T5 zusammenhängende Span-Sequenzen und ersetzt sie durch Sentinel-Tokens. Das Modell muss die fehlenden Spans als Sequenz generieren. Diese Strategie liegt näher an realistischen Generierungs-Aufgaben und nutzt die Encoder-Decoder-Struktur optimal aus.

Wo wird T5 heute eingesetzt?+

T5 und besonders Flan-T5 werden vielfach für Übersetzung, Zusammenfassung, Question Answering und Schema-zu-Text-Tasks eingesetzt, oft auf eigenen Servern statt API. Open-Source-Pipelines wie Hugging Face Transformers, Llama Index und LangChain bieten Flan-T5 als kostengünstige Alternative zu proprietären LLMs für strukturierte Aufgaben.

Wie unterscheidet sich T5 von BERT und GPT?+

BERT ist Encoder-only und für Verständnis-Aufgaben optimiert, GPT ist Decoder-only und für autoregressive Generierung optimiert. T5 ist Encoder-Decoder und für Sequence-to-Sequence-Aufgaben optimiert. T5 bringt einen klaren Input-Output-Schnitt und ist für strukturierte Generierungs-Aufgaben wie Übersetzung und Zusammenfassung qualitativ überlegen.

Verwandte Begriffe

Quellen

  • Raffel et al. (2019) Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer
  • Xue et al. (2020) mT5 Multilingual T5
  • Chung et al. (2022) Scaling Instruction-Finetuned Language Models (Flan-T5)
  • Hugging Face Transformers Documentation

Wikidata: Q86993773 · Zuletzt geprüft: 2026-07-02