KI-Modell-Zeittafel
Chronologische Übersicht der wichtigsten KI-Modelle seit 2012, gegliedert nach Sprachmodellen, Computer Vision und Multimodal sowie Reasoning- und Agent-Modellen.
Sprachmodelle / NLP
Die folgende Tabelle dokumentiert die wichtigsten Sprachmodelle und NLP-Architekturen seit der Einführung des Transformers 2017. Sie umfasst proprietäre Frontier-Modelle (GPT, Claude, Gemini), Open-Source-Familien (Llama, Mistral, Qwen) sowie historisch bedeutsame Forschungs-Modelle (BERT, T5, PaLM).
| Jahr | Modell | Org | Architektur | Notable |
|---|---|---|---|---|
| 2017 | Transformer | Google Brain | Encoder-Decoder | Attention Is All You Need, Grundlage aller modernen LLMs |
| 2018 | BERT | Google AI | Encoder-only | Bidirektionale Repräsentationen, NLP-Standard für Verständnis |
| 2018 | GPT-1 | OpenAI | Decoder-only | 117M Parameter, erste Demonstration generativer Pretraining |
| 2019 | GPT-2 | OpenAI | Decoder-only | 1.5B Parameter, zunächst aus Sicherheitsgründen zurückgehalten |
| 2019 | T5 | Encoder-Decoder | Text-to-Text-Paradigma, alle Tasks als Sequence-to-Sequence | |
| 2020 | GPT-3 | OpenAI | Decoder-only | 175B Parameter, Few-Shot Learning, Auslöser der LLM-Welle |
| 2022 | PaLM | Decoder-only | 540B Parameter, neue Reasoning-Benchmarks | |
| 2022 | GPT-3.5 / ChatGPT | OpenAI | Decoder-only + RLHF | Konsumenten-Durchbruch, 100M Nutzer in 2 Monaten |
| 2023 | GPT-4 | OpenAI | MoE Decoder-only | Multimodal Text+Bild, viele Benchmark-Rekorde |
| 2023 | Claude 1 / 2 | Anthropic | Decoder-only + Constitutional AI | 100k Kontext, alternative Alignment-Methode |
| 2023 | Llama 1 / 2 | Meta | Decoder-only | Open-Weights, Auslöser des Open-LLM-Ökosystems |
| 2023 | PaLM 2 | Decoder-only | Mehrsprachig, Code-Reasoning, Engine hinter Bard | |
| 2023 | Mistral 7B / Mixtral | Mistral AI | Decoder-only / MoE | Europäisches Frontier-Lab, Apache-2.0-Lizenz |
| 2024 | GPT-4o | OpenAI | Nativ multimodal | Echtzeit-Sprache, ein Modell für Text+Bild+Audio |
| 2024 | Claude 3 / 3.5 | Anthropic | Decoder-only | Opus, Sonnet, Haiku Tiers; 3.5 Sonnet (Juni, v2 im Oktober) mit starker Coding-Performance |
| 2024 | Gemini 1.5 | Google DeepMind | MoE Decoder-only | 2M Kontextfenster, native Long-Context |
| 2024 | Llama 3 / 3.1 / 3.3 | Meta | Decoder-only | Bis 405B Parameter (3.1), schliesst Lücke zu Closed-Source; 3.3 (Dezember) mit Effizienz-Sprung |
| 2024 | o1 | OpenAI | Reasoning-Modell | Chain-of-Thought internalisiert, neue Mathe-Rekorde |
| 2024 | DeepSeek V3 | DeepSeek | MoE Decoder-only | Chinesisches Open-Source-Frontier-Modell, niedrige Trainingskosten |
| 2024 | Qwen 2.5 | Alibaba | Decoder-only | Mehrsprachig, starke Mathematik, Open-Weights bis 72B |
| 2024 | Gemini 2.0 | Google DeepMind | MoE Decoder-only | Flash als Standardmodell, Agent-Fokus (Dezember) |
| 2025 | GPT-4.5 | OpenAI | MoE Decoder-only | Grösstes Pretraining-Scale-Modell von OpenAI (Februar), Fokus Schreiben und weniger Halluzinationen, kurz darauf aus der API zurückgezogen |
| 2025 | Claude 3.7 Sonnet | Anthropic | Decoder-only | Hybrid-Reasoning mit Extended Thinking (Februar) |
| 2025 | Claude 4 (Opus 4 / Sonnet 4) | Anthropic | Decoder-only | Verbesserte Coding- und Agent-Fähigkeiten (Mai); Sonnet 4.5 folgt im September |
| 2025 | Gemini 2.5 | Google DeepMind | MoE Decoder-only | Thinking-Modelle, tighter Agent-Integration (März) |
| 2025 | GPT-5 | OpenAI | Reasoning + Generation | Unified Model, integriertes Reasoning (August) |
| 2025 | Gemini 3 | Google DeepMind | MoE Decoder-only | Neue Modellgeneration (November) |
| 2026 | Claude Opus 4.7 | Anthropic | Decoder-only | Aktuelles Anthropic-Flaggschiff, verbessertes Tool Use |
Quelle: arXiv-Publikationen der jeweiligen Labors, offizielle Pressemitteilungen von OpenAI, Anthropic, Google DeepMind und Meta AI, Hugging Face Modellkarten.
Computer Vision und Multimodal
Die Vision-Tabelle dokumentiert den Aufstieg neuronaler Netze in der Bildverarbeitung seit AlexNet (2012) sowie den Übergang zu Vision-Transformern und multimodalen Foundation-Modellen.
| Jahr | Modell | Org | Architektur | Notable |
|---|---|---|---|---|
| 2012 | AlexNet | Univ. Toronto | CNN | ImageNet-Sieg, Auslöser der Deep-Learning-Revolution |
| 2014 | VGG | Univ. Oxford | CNN | Tiefe einheitliche Architektur, lange Referenz-Backbone |
| 2014 | GAN | Univ. Montréal | Generator-Discriminator | Goodfellow et al., Generative Modelling fundamental |
| 2015 | ResNet | Microsoft Research | CNN + Residual | 152 Schichten möglich, bis heute relevanter Backbone |
| 2015 | U-Net | Univ. Freiburg | Encoder-Decoder | Medizinische Segmentierung, später Basis von Diffusion-Modellen |
| 2016 | YOLO | Univ. Washington | One-Stage Detector | Echtzeit-Objektdetektion, Real-World-Deployment |
| 2020 | ViT (Vision Transformer) | Google Research | Transformer | Transformer schlägt CNN auf ImageNet bei genug Daten |
| 2021 | CLIP | OpenAI | Contrastive Vision-Text | Zero-Shot-Klassifikation via Sprach-Bild-Embedding |
| 2021 | DALL-E 1 | OpenAI | Autoregressive Vision | Erstes breit bekanntes Text-zu-Bild-Modell |
| 2022 | DALL-E 2 | OpenAI | Diffusion + CLIP | Erste hochqualitative Diffusion-Bilder |
| 2022 | Stable Diffusion 1 / 2 | Stability AI / LMU | Latent Diffusion | Open-Source, Auslöser der Bild-KI-Welle; 2.0 im November |
| 2022 | Midjourney 1-4 | Midjourney | Diffusion | Discord-basiertes Konsumenten-Produkt |
| 2022 | Whisper | OpenAI | Encoder-Decoder Audio | Mehrsprachige robuste Spracherkennung |
| 2023 | DALL-E 3 | OpenAI | Diffusion | Bessere Prompt-Treue, in ChatGPT integriert |
| 2023 | SDXL | Stability AI | Latent Diffusion | Höhere Auflösung, modulare Refiner-Architektur (Juli) |
| 2023 | Midjourney 5 / 6 | Midjourney | Diffusion | Photorealismus (v5 im März), V6 (Dezember) mit besserer Text-Wiedergabe |
| 2024 | Stable Diffusion 3 / 3.5 | Stability AI | Diffusion + Transformer | Multimodal-Diffusion-Transformer, neue Bildqualität; 3.5 (Oktober) als Refresh nach Krise |
| 2024 | Sora | OpenAI | Diffusion + Transformer | Erstes Frontier-Text-zu-Video-Modell (Februar Preview, Dezember als Produkt) |
| 2025 | Veo 2 / Veo 3 | Google DeepMind | Diffusion-Transformer | Lange kohärente Videos mit Audio |
| 2025 | Midjourney 7 | Midjourney | Diffusion | Neue Modellgeneration mit Draft Mode (April) |
| 2025 | Sora 2 | OpenAI | Diffusion-Transformer | Längere Sequenzen, bessere Physik-Kohärenz (September) |
Quelle: arXiv-Publikationen, ImageNet- und COCO-Leaderboards, offizielle Modell-Karten und Pressemitteilungen.
Reasoning und Agents
Die Reasoning-Tabelle dokumentiert Modelle und Methoden, die explizit auf mehrstufiges Schlussfolgern, Werkzeugnutzung und autonome Agenten-Workflows ausgelegt sind.
| Jahr | Modell | Org | Architektur | Notable |
|---|---|---|---|---|
| 2022 | Chain-of-Thought Prompting | Google Research | Prompt-Methode | Wei et al., explizites Schritt-für-Schritt-Reasoning |
| 2022 | ReAct | Princeton + Google | Prompt-Pattern | Reasoning + Acting, Grundlage moderner Agent-Loops |
| 2023 | Toolformer | Meta AI | Tool Use Training | Selbst-trainiertes Tool-Use ohne menschliche Annotation |
| 2023 | GPT-4 Function Calling | OpenAI | Strukturierte Tool API | Erste breite Standard-API für Werkzeugnutzung |
| 2023 | AutoGPT | Open Source | Agent-Loop | Erstes virales autonomes Agent-Framework |
| 2023 | BabyAGI | Open Source | Agent-Loop | Task-Decomposition-Demo, vereinfachtes AGI-Konzept |
| 2024 | Claude Tool Use | Anthropic | Strukturierte Tool API | Robuste Tool-Use-Standardisierung für Production |
| 2024 | Devin | Cognition Labs | Autonomous SWE Agent | Erstes kommerzielles autonomes Software-Engineer-Produkt |
| 2024 | o1 | OpenAI | Reasoning-LLM | RL auf Chain-of-Thought, Math-Olympia-Niveau |
| 2024 | Anthropic Computer Use | Anthropic | Multimodal Agent | Maus- und Tastatursteuerung des Computers via Modell |
| 2025 | o3 / o3-pro | OpenAI | Reasoning-LLM | ARC-AGI-Durchbruch, neue Reasoning-Benchmarks |
| 2025 | OpenAI Operator | OpenAI | Browser-Agent | Konsumenten-Produkt für Web-Automatisierung (Januar), Mitte 2025 im ChatGPT Agent aufgegangen |
| 2025 | Claude Code | Anthropic | CLI-Coding-Agent | Terminal-basierter Coding-Agent, breite Developer-Adoption |
| 2025 | Gemini Agent | Google DeepMind | Multimodal Agent | Native Browser- und App-Steuerung |
| 2025 | GPT-5 Agents | OpenAI | Unified Reasoning + Tools | Integriertes Reasoning und Agent-Loop in einem Modell |
Quelle: arXiv-Publikationen, Anthropic- und OpenAI-System-Cards, Pressemitteilungen, GitHub-Releases von AutoGPT und BabyAGI.
Methodik
Die Aufnahmekriterien folgen drei Achsen. Erstens Capability-Sprünge: ein Modell erscheint, wenn es einen messbaren neuen Benchmark-Rekord aufstellt oder eine neue Architektur-Familie etabliert. Zweitens Adoption: Modelle mit breiter Produkt-Verbreitung oder hoher Forschungs-Resonanz werden auch dann gelistet, wenn sie inkrementell sind. Drittens Diversität: wir balancieren proprietäre Frontier-Modelle, Open-Source-Familien und Forschungs-Meilensteine, um die Branche realitätsgetreu abzubilden.
Parameter-Zahlen sind Schätzungen, wo offizielle Angaben fehlen. Für proprietäre Modelle (GPT-4, Claude, Gemini) basieren die Angaben auf Branchenleaks und Reverse-Engineering und sollten als grössenordnungsgemäss verstanden werden. Open-Source-Modelle mit veröffentlichten Gewichten sind exakt.
Die Zeittafel verzichtet bewusst auf vollständige Vollständigkeit: das Ziel ist die kuratierte Übersicht, nicht das exhaustive Verzeichnis. Wer auf der Suche nach exhaustiven Modell-Vergleichen ist, sei auf das Stanford HAI AI Index Report und die Hugging Face Leaderboards verwiesen.
Stand: 2026-07-02. Tabellen werden quartalsweise aktualisiert.
Weiter im KI-Lexikon
← Zurück zum LexikonHäufige Fragen
Was ist die KI-Modell-Zeittafel?+
Die Zeittafel ist eine kuratierte, chronologische Übersicht der wichtigsten KI-Modelle der letzten Jahre. Sie ordnet jedes Modell nach Veröffentlichungsjahr, Organisation, Architektur und einem prägnanten Notable-Eintrag. Drei Tabellen decken Sprachmodelle, Computer Vision und Multimodal sowie Reasoning- und Agent-Modelle ab.
Welche Auswahlkriterien gelten für die Aufnahme?+
Aufgenommen werden Modelle, die einen messbaren Sprung in Capability, Architektur oder Adoption markieren: neue Benchmark-Rekorde, neue Architektur-Familien, breite Verbreitung in Produkten oder Forschung, oder klare Branchen-Auswirkung. Reine Re-Releases ohne substanziellen Unterschied erscheinen nicht separat.
Warum beginnt die Vision-Tabelle 2012?+
AlexNet (2012) gilt als Auslöser der Deep-Learning-Revolution, weil der ImageNet-Sieg mit deutlichem Vorsprung die Branche von klassischen Computer-Vision-Methoden auf neuronale Netze umstellte. Frühere Modelle wie LeNet (1998) sind historisch wichtig, gehören aber zur Vor-Revolution.
Warum erscheinen manche Modelle in mehreren Tabellen nicht?+
Multimodale Modelle wie GPT-4o oder Gemini sind in der NLP-Tabelle gelistet, weil das Sprachmodell den Kern bildet. CLIP und Whisper hingegen sind in der Vision-Tabelle, weil sie als Vision- bzw. Audio-Modelle konzipiert sind. Wir vermeiden Doppellistungen und ordnen nach Schwerpunkt.
Wie oft wird die Zeittafel aktualisiert?+
Die Zeittafel wird quartalsweise gepflegt. Zwischen den Updates können einzelne Einträge bei wichtigen Releases korrigiert werden, der grosse Review erfolgt jeweils im März, Juni, September und Dezember. Quellen sind die offiziellen Pressemitteilungen, arXiv-Publikationen und unabhängige Benchmark-Berichte.
Verwandte Begriffe
Quellen
- arXiv Papers (2012-2026)
- OpenAI, Anthropic, Google DeepMind, Meta AI Pressemitteilungen
- Stanford HAI AI Index Report 2024 und 2025
- Papers With Code Leaderboards
Zuletzt geprüft: 2026-07-02