Agentic Relations

KI-Modell-Zeittafel

Chronologische Übersicht der wichtigsten KI-Modelle seit 2012, gegliedert nach Sprachmodellen, Computer Vision und Multimodal sowie Reasoning- und Agent-Modellen.

Sprachmodelle / NLP

Die folgende Tabelle dokumentiert die wichtigsten Sprachmodelle und NLP-Architekturen seit der Einführung des Transformers 2017. Sie umfasst proprietäre Frontier-Modelle (GPT, Claude, Gemini), Open-Source-Familien (Llama, Mistral, Qwen) sowie historisch bedeutsame Forschungs-Modelle (BERT, T5, PaLM).

JahrModellOrgArchitekturNotable
2017TransformerGoogle BrainEncoder-DecoderAttention Is All You Need, Grundlage aller modernen LLMs
2018BERTGoogle AIEncoder-onlyBidirektionale Repräsentationen, NLP-Standard für Verständnis
2018GPT-1OpenAIDecoder-only117M Parameter, erste Demonstration generativer Pretraining
2019GPT-2OpenAIDecoder-only1.5B Parameter, zunächst aus Sicherheitsgründen zurückgehalten
2019T5GoogleEncoder-DecoderText-to-Text-Paradigma, alle Tasks als Sequence-to-Sequence
2020GPT-3OpenAIDecoder-only175B Parameter, Few-Shot Learning, Auslöser der LLM-Welle
2022PaLMGoogleDecoder-only540B Parameter, neue Reasoning-Benchmarks
2022GPT-3.5 / ChatGPTOpenAIDecoder-only + RLHFKonsumenten-Durchbruch, 100M Nutzer in 2 Monaten
2023GPT-4OpenAIMoE Decoder-onlyMultimodal Text+Bild, viele Benchmark-Rekorde
2023Claude 1 / 2AnthropicDecoder-only + Constitutional AI100k Kontext, alternative Alignment-Methode
2023Llama 1 / 2MetaDecoder-onlyOpen-Weights, Auslöser des Open-LLM-Ökosystems
2023PaLM 2GoogleDecoder-onlyMehrsprachig, Code-Reasoning, Engine hinter Bard
2023Mistral 7B / MixtralMistral AIDecoder-only / MoEEuropäisches Frontier-Lab, Apache-2.0-Lizenz
2024GPT-4oOpenAINativ multimodalEchtzeit-Sprache, ein Modell für Text+Bild+Audio
2024Claude 3 / 3.5AnthropicDecoder-onlyOpus, Sonnet, Haiku Tiers; 3.5 Sonnet (Juni, v2 im Oktober) mit starker Coding-Performance
2024Gemini 1.5Google DeepMindMoE Decoder-only2M Kontextfenster, native Long-Context
2024Llama 3 / 3.1 / 3.3MetaDecoder-onlyBis 405B Parameter (3.1), schliesst Lücke zu Closed-Source; 3.3 (Dezember) mit Effizienz-Sprung
2024o1OpenAIReasoning-ModellChain-of-Thought internalisiert, neue Mathe-Rekorde
2024DeepSeek V3DeepSeekMoE Decoder-onlyChinesisches Open-Source-Frontier-Modell, niedrige Trainingskosten
2024Qwen 2.5AlibabaDecoder-onlyMehrsprachig, starke Mathematik, Open-Weights bis 72B
2024Gemini 2.0Google DeepMindMoE Decoder-onlyFlash als Standardmodell, Agent-Fokus (Dezember)
2025GPT-4.5OpenAIMoE Decoder-onlyGrösstes Pretraining-Scale-Modell von OpenAI (Februar), Fokus Schreiben und weniger Halluzinationen, kurz darauf aus der API zurückgezogen
2025Claude 3.7 SonnetAnthropicDecoder-onlyHybrid-Reasoning mit Extended Thinking (Februar)
2025Claude 4 (Opus 4 / Sonnet 4)AnthropicDecoder-onlyVerbesserte Coding- und Agent-Fähigkeiten (Mai); Sonnet 4.5 folgt im September
2025Gemini 2.5Google DeepMindMoE Decoder-onlyThinking-Modelle, tighter Agent-Integration (März)
2025GPT-5OpenAIReasoning + GenerationUnified Model, integriertes Reasoning (August)
2025Gemini 3Google DeepMindMoE Decoder-onlyNeue Modellgeneration (November)
2026Claude Opus 4.7AnthropicDecoder-onlyAktuelles Anthropic-Flaggschiff, verbessertes Tool Use

Quelle: arXiv-Publikationen der jeweiligen Labors, offizielle Pressemitteilungen von OpenAI, Anthropic, Google DeepMind und Meta AI, Hugging Face Modellkarten.

Computer Vision und Multimodal

Die Vision-Tabelle dokumentiert den Aufstieg neuronaler Netze in der Bildverarbeitung seit AlexNet (2012) sowie den Übergang zu Vision-Transformern und multimodalen Foundation-Modellen.

JahrModellOrgArchitekturNotable
2012AlexNetUniv. TorontoCNNImageNet-Sieg, Auslöser der Deep-Learning-Revolution
2014VGGUniv. OxfordCNNTiefe einheitliche Architektur, lange Referenz-Backbone
2014GANUniv. MontréalGenerator-DiscriminatorGoodfellow et al., Generative Modelling fundamental
2015ResNetMicrosoft ResearchCNN + Residual152 Schichten möglich, bis heute relevanter Backbone
2015U-NetUniv. FreiburgEncoder-DecoderMedizinische Segmentierung, später Basis von Diffusion-Modellen
2016YOLOUniv. WashingtonOne-Stage DetectorEchtzeit-Objektdetektion, Real-World-Deployment
2020ViT (Vision Transformer)Google ResearchTransformerTransformer schlägt CNN auf ImageNet bei genug Daten
2021CLIPOpenAIContrastive Vision-TextZero-Shot-Klassifikation via Sprach-Bild-Embedding
2021DALL-E 1OpenAIAutoregressive VisionErstes breit bekanntes Text-zu-Bild-Modell
2022DALL-E 2OpenAIDiffusion + CLIPErste hochqualitative Diffusion-Bilder
2022Stable Diffusion 1 / 2Stability AI / LMULatent DiffusionOpen-Source, Auslöser der Bild-KI-Welle; 2.0 im November
2022Midjourney 1-4MidjourneyDiffusionDiscord-basiertes Konsumenten-Produkt
2022WhisperOpenAIEncoder-Decoder AudioMehrsprachige robuste Spracherkennung
2023DALL-E 3OpenAIDiffusionBessere Prompt-Treue, in ChatGPT integriert
2023SDXLStability AILatent DiffusionHöhere Auflösung, modulare Refiner-Architektur (Juli)
2023Midjourney 5 / 6MidjourneyDiffusionPhotorealismus (v5 im März), V6 (Dezember) mit besserer Text-Wiedergabe
2024Stable Diffusion 3 / 3.5Stability AIDiffusion + TransformerMultimodal-Diffusion-Transformer, neue Bildqualität; 3.5 (Oktober) als Refresh nach Krise
2024SoraOpenAIDiffusion + TransformerErstes Frontier-Text-zu-Video-Modell (Februar Preview, Dezember als Produkt)
2025Veo 2 / Veo 3Google DeepMindDiffusion-TransformerLange kohärente Videos mit Audio
2025Midjourney 7MidjourneyDiffusionNeue Modellgeneration mit Draft Mode (April)
2025Sora 2OpenAIDiffusion-TransformerLängere Sequenzen, bessere Physik-Kohärenz (September)

Quelle: arXiv-Publikationen, ImageNet- und COCO-Leaderboards, offizielle Modell-Karten und Pressemitteilungen.

Reasoning und Agents

Die Reasoning-Tabelle dokumentiert Modelle und Methoden, die explizit auf mehrstufiges Schlussfolgern, Werkzeugnutzung und autonome Agenten-Workflows ausgelegt sind.

JahrModellOrgArchitekturNotable
2022Chain-of-Thought PromptingGoogle ResearchPrompt-MethodeWei et al., explizites Schritt-für-Schritt-Reasoning
2022ReActPrinceton + GooglePrompt-PatternReasoning + Acting, Grundlage moderner Agent-Loops
2023ToolformerMeta AITool Use TrainingSelbst-trainiertes Tool-Use ohne menschliche Annotation
2023GPT-4 Function CallingOpenAIStrukturierte Tool APIErste breite Standard-API für Werkzeugnutzung
2023AutoGPTOpen SourceAgent-LoopErstes virales autonomes Agent-Framework
2023BabyAGIOpen SourceAgent-LoopTask-Decomposition-Demo, vereinfachtes AGI-Konzept
2024Claude Tool UseAnthropicStrukturierte Tool APIRobuste Tool-Use-Standardisierung für Production
2024DevinCognition LabsAutonomous SWE AgentErstes kommerzielles autonomes Software-Engineer-Produkt
2024o1OpenAIReasoning-LLMRL auf Chain-of-Thought, Math-Olympia-Niveau
2024Anthropic Computer UseAnthropicMultimodal AgentMaus- und Tastatursteuerung des Computers via Modell
2025o3 / o3-proOpenAIReasoning-LLMARC-AGI-Durchbruch, neue Reasoning-Benchmarks
2025OpenAI OperatorOpenAIBrowser-AgentKonsumenten-Produkt für Web-Automatisierung (Januar), Mitte 2025 im ChatGPT Agent aufgegangen
2025Claude CodeAnthropicCLI-Coding-AgentTerminal-basierter Coding-Agent, breite Developer-Adoption
2025Gemini AgentGoogle DeepMindMultimodal AgentNative Browser- und App-Steuerung
2025GPT-5 AgentsOpenAIUnified Reasoning + ToolsIntegriertes Reasoning und Agent-Loop in einem Modell

Quelle: arXiv-Publikationen, Anthropic- und OpenAI-System-Cards, Pressemitteilungen, GitHub-Releases von AutoGPT und BabyAGI.

Methodik

Die Aufnahmekriterien folgen drei Achsen. Erstens Capability-Sprünge: ein Modell erscheint, wenn es einen messbaren neuen Benchmark-Rekord aufstellt oder eine neue Architektur-Familie etabliert. Zweitens Adoption: Modelle mit breiter Produkt-Verbreitung oder hoher Forschungs-Resonanz werden auch dann gelistet, wenn sie inkrementell sind. Drittens Diversität: wir balancieren proprietäre Frontier-Modelle, Open-Source-Familien und Forschungs-Meilensteine, um die Branche realitätsgetreu abzubilden.

Parameter-Zahlen sind Schätzungen, wo offizielle Angaben fehlen. Für proprietäre Modelle (GPT-4, Claude, Gemini) basieren die Angaben auf Branchenleaks und Reverse-Engineering und sollten als grössenordnungsgemäss verstanden werden. Open-Source-Modelle mit veröffentlichten Gewichten sind exakt.

Die Zeittafel verzichtet bewusst auf vollständige Vollständigkeit: das Ziel ist die kuratierte Übersicht, nicht das exhaustive Verzeichnis. Wer auf der Suche nach exhaustiven Modell-Vergleichen ist, sei auf das Stanford HAI AI Index Report und die Hugging Face Leaderboards verwiesen.

Stand: 2026-07-02. Tabellen werden quartalsweise aktualisiert.

Weiter im KI-Lexikon

← Zurück zum Lexikon

Häufige Fragen

Was ist die KI-Modell-Zeittafel?+

Die Zeittafel ist eine kuratierte, chronologische Übersicht der wichtigsten KI-Modelle der letzten Jahre. Sie ordnet jedes Modell nach Veröffentlichungsjahr, Organisation, Architektur und einem prägnanten Notable-Eintrag. Drei Tabellen decken Sprachmodelle, Computer Vision und Multimodal sowie Reasoning- und Agent-Modelle ab.

Welche Auswahlkriterien gelten für die Aufnahme?+

Aufgenommen werden Modelle, die einen messbaren Sprung in Capability, Architektur oder Adoption markieren: neue Benchmark-Rekorde, neue Architektur-Familien, breite Verbreitung in Produkten oder Forschung, oder klare Branchen-Auswirkung. Reine Re-Releases ohne substanziellen Unterschied erscheinen nicht separat.

Warum beginnt die Vision-Tabelle 2012?+

AlexNet (2012) gilt als Auslöser der Deep-Learning-Revolution, weil der ImageNet-Sieg mit deutlichem Vorsprung die Branche von klassischen Computer-Vision-Methoden auf neuronale Netze umstellte. Frühere Modelle wie LeNet (1998) sind historisch wichtig, gehören aber zur Vor-Revolution.

Warum erscheinen manche Modelle in mehreren Tabellen nicht?+

Multimodale Modelle wie GPT-4o oder Gemini sind in der NLP-Tabelle gelistet, weil das Sprachmodell den Kern bildet. CLIP und Whisper hingegen sind in der Vision-Tabelle, weil sie als Vision- bzw. Audio-Modelle konzipiert sind. Wir vermeiden Doppellistungen und ordnen nach Schwerpunkt.

Wie oft wird die Zeittafel aktualisiert?+

Die Zeittafel wird quartalsweise gepflegt. Zwischen den Updates können einzelne Einträge bei wichtigen Releases korrigiert werden, der grosse Review erfolgt jeweils im März, Juni, September und Dezember. Quellen sind die offiziellen Pressemitteilungen, arXiv-Publikationen und unabhängige Benchmark-Berichte.

Verwandte Begriffe

Quellen

  • arXiv Papers (2012-2026)
  • OpenAI, Anthropic, Google DeepMind, Meta AI Pressemitteilungen
  • Stanford HAI AI Index Report 2024 und 2025
  • Papers With Code Leaderboards

Zuletzt geprüft: 2026-07-02