Gemini (Google)
Multimodale LLM-Familie von Google DeepMind, die Text, Bild, Audio und Video nativ verarbeitet und in den Varianten Pro, Flash und Nano angeboten wird.
Definition
Gemini ist die multimodale LLM-Familie von Google DeepMind, die im Dezember 2023 erstmals veröffentlicht wurde. Der Name verweist auf das Sternzeichen der Zwillinge und symbolisiert den Zusammenschluss der ehemals getrennten Google-Brain- und DeepMind-Teams zu Google DeepMind im April 2023. Gemini ist Googles direkte und strategisch zentrale Antwort auf GPT-4 und Claude und treibt sowohl die Google-Suche (AI Overviews) als auch Google Workspace.
Im Unterschied zu GPT-4 wurde Gemini von Beginn an nativ multimodal entwickelt: Text, Bild, Audio und Video werden in einer gemeinsamen Repräsentation verarbeitet, statt separate Encoder zu kombinieren. Diese Architekturentscheidung erlaubt bessere Cross-Modal-Reasoning-Leistung, insbesondere bei Video-Verständnis und bei Tasks, die mehrere Modalitäten gleichzeitig kombinieren.
Architektur
Gemini basiert auf einer Decoder-only-Transformer-Architektur mit Mixture-of-Experts (MoE), die seit Gemini 1.5 öffentlich bestätigt ist. Die wesentlichen Merkmale:
- Native Multimodalität: Audio wird über Universal Speech Model (USM) tokenisiert, Bilder über einen vision-spezifischen Tokenizer, Video als Sequenz von Frames. Alle Modalitäten landen in einem gemeinsamen Token-Stream.
- Mixture of Experts: Pro Forward-Pass wird nur ein Teil der Parameter aktiviert, was grosse Kapazität bei moderater Inferenz-Cost erlaubt.
- Long Context: Spezialisierte Aufmerksamkeits-Mechanismen ermöglichen 1 bis 2 Millionen Tokens Kontextfenster, deutlich mehr als OpenAI und gleichauf mit oder vor Anthropic.
- Training auf TPU v5p: Google nutzt seine eigene Hardware, was strategische Unabhängigkeit von NVIDIA bedeutet und Kostenvorteile bei der Inferenz erlaubt.
Die Trainingsdaten umfassen massive Web-Korpora, YouTube-Transkripte (mit klaren Limits), Code-Repositories und Google-eigene strukturierte Daten. Konkrete Mengen sind nicht veröffentlicht.
Praxis
Gemini ist in Googles Produktportfolio breit verankert:
- Google-Suche: AI Overviews liefern Gemini-Zusammenfassungen oberhalb der klassischen Treffer.
- Google Workspace: Gemini in Gmail, Docs, Sheets, Slides für E-Mail-Entwürfe, Zusammenfassungen, Tabellen-Formeln.
- NotebookLM: Research-Tool mit Source-Grounding und Audio-Overviews (Podcast-Style-Briefings).
- Gemini App: Konsumenten-Chatbot auf Web, Android, iOS, mit Gemini Live für natürliche Sprach-Konversation.
- Vertex AI: Enterprise-Plattform mit Gemini-API, RAG-Tools, Grounding mit Google Search.
- Android und Pixel: On-Device-Inferenz mit Gemini Nano, ersetzt schrittweise Google Assistant.
Die API-Preisstruktur (Stand 2025): Gemini 2.0 Flash bei 0.10 Dollar pro Million Input und 0.40 Dollar Output, Gemini 2.5 Flash bei 0.30 Dollar Input und 2.50 Dollar Output, Pro bei 1.25 bis 5 Dollar Input und 5 bis 15 Dollar Output. Long-Context-Anfragen über 128k Tokens werden gesondert berechnet. Free-Tier in Google AI Studio ermöglicht kostenloses Prototyping mit grosszügigen Limits.
Häufige Fehler
- Modell-Bezeichnung verwechseln: Bard, Gemini App, Gemini API und Vertex AI Gemini sind verschiedene Produkte mit unterschiedlichen Preisen, Limits und Datenschutz-Bedingungen.
- Long Context als Allheilmittel betrachten: Auch bei 2M Tokens Kontextfenster sinkt die Recall-Qualität bei sehr verteilten Informationen. Strukturiertes RAG bleibt oft die robustere Lösung.
- Bildgenerierung mit Imagen verwechseln: Imagen ist Googles eigenständiges Text-to-Image-Modell. Seit 2025 generiert Gemini zusätzlich nativ Bilder: zuerst Gemini 2.0 Flash Image Generation, seit August 2025 Gemini 2.5 Flash Image (bekannt als Nano Banana). Beide Wege haben unterschiedliche Stärken und Preise.
- Sicherheits-Filter unterschätzen: Gemini ist konservativer als GPT-4 oder Claude bei sensiblen Themen, was für manche Anwendungen einschränkend wirkt und in Vertex AI über Safety-Settings angepasst werden muss.
- Vendor Lock-in mit Google-Tools: Tight Integration mit Workspace, Search Grounding und YouTube ist ein Feature, schafft aber Abhängigkeiten, die in Multi-Vendor-Strategien sauber kompensiert werden müssen.
Abgrenzung
- GPT-4 (OpenAI): Hauptkonkurrent, vergleichbare Reasoning-Qualität, geringeres Kontextfenster, breitere Developer-Community.
- Claude (Anthropic): Hauptkonkurrent, lange Zeit besser bei Coding und nuanciertem Reasoning, vergleichbares Kontextfenster.
- Llama (Meta): Open-Source-Alternative, geringere Frontier-Performance, dafür lokal lauffähig und beliebig anpassbar.
- Imagen 3 / Veo / Lyria: Googles spezialisierte Generative-Modelle für Bild, Video und Musik. Werden teils von Gemini per Tool-Call orchestriert.
- PaLM 2: der direkte Vorgänger, 2023 noch aktiv, seit Gemini-Release vollständig abgelöst.
- AlphaCode 2 / AlphaProof: DeepMind-Reasoning-Modelle, technisch eigene Familie, teils auf Gemini-Stack basierend, nicht direkt für Endnutzer verfügbar.
Weiter im KI-Lexikon
← Zurück zum LexikonHäufige Fragen
Was ist Gemini?+
Gemini ist die multimodale LLM-Familie von Google DeepMind, die im Dezember 2023 erstmals veröffentlicht wurde. Sie verarbeitet Text, Bild, Audio und Video nativ in einem einzigen Modell, statt separate Encoder zu kombinieren. Gemini ist Googles direkte Antwort auf GPT-4 und Claude und treibt sowohl die Google-Suche als auch Google Workspace.
Welche Gemini-Varianten gibt es?+
Die Hauptvarianten sind Pro (Flaggschiff für komplexe Tasks), Flash (schnell und günstig für High-Volume), Flash-Lite und Nano (für On-Device-Inferenz auf Pixel-Phones). Die Variante Ultra gab es nur in der ersten Generation 1.0 (2023/24). Seit Gemini 2.0 ist Flash das Standard-Default-Modell und deckt fast alle API-Anwendungen ab.
Was kann Gemini, was GPT-4 nicht kann?+
Gemini ist nativ multimodal: Video-Eingabe direkt in den Kontext, ein 1-Million-Tokens-Kontextfenster (Gemini 1.5 Pro bot bis 2 Millionen), native Tool-Integration mit Google-Suche, YouTube und Maps. Code Execution und Imagen-3-Bildgenerierung sind direkt eingebaut. Für long-context-RAG ist Gemini oft die stärkere Wahl.
Wie ist Gemini in Google-Produkte integriert?+
Gemini treibt die AI Overviews in der Google-Suche, Gemini Live als Sprach-Assistent, Gemini in Gmail/Docs/Sheets/Slides (Workspace AI), Notebook LM für Research, Gemini Code Assist für Entwickler und Bard wurde 2024 zu Gemini umbenannt. Auf Android-Geräten und Pixel-Phones ersetzt Gemini zunehmend Google Assistant.
Was kostet Gemini in der API?+
Gemini-Preise variieren stark: Gemini 2.0 Flash kostet 0.10 Dollar pro Million Input und 0.40 Dollar Output, Gemini 2.5 Flash 0.30 Dollar Input und 2.50 Dollar Output (Stand 2025). Pro liegt bei 1.25 bis 5 Dollar Input und 5 bis 15 Dollar Output. Long-Context-Anfragen über 128k Tokens werden teurer abgerechnet. Free-Tier in Google AI Studio ist grosszügig, für Prototyping kostenlos nutzbar.
Wie gross ist das Gemini-Kontextfenster?+
Gemini 1.5 Pro war das erste produktive Modell mit 1-Million-Tokens-Kontextfenster (Februar 2024), später auf 2 Millionen erweitert und experimentell bis 10 Millionen getestet. Gemini 2.0 Flash und 2.5 Pro bieten standardmässig 1 Million Tokens. Damit liegt Google an der Spitze beim Long-Context-Reasoning, vor OpenAI (128k bis 1M) und gleichauf mit Anthropic (1M).
Was sind Schwächen von Gemini?+
Gemini war in den ersten Monaten teils inkonsistent in Reasoning-Qualität, Bildgenerierung wurde wegen Diversitätsproblemen kurzzeitig gestoppt (Februar 2024), und die Marken-Verwirrung zwischen Bard, Gemini App, Gemini API und Vertex AI Gemini bleibt für Einsteiger schwierig. Bei Coding-Tasks galt Claude lange als überlegen.
Wer nutzt Gemini in der Praxis?+
Gemini ist über die Google-Suche praktisch in jedem Haushalt vertreten. Unternehmen nutzen es über Vertex AI für RAG-Pipelines mit langem Kontext, für Workspace-Integrationen und in Android-Apps. Marktanteile in der Developer-API liegen hinter OpenAI, holen aber seit Gemini 2.0 schnell auf.
Verwandte Begriffe
Quellen
- Google DeepMind (2023) Gemini Technical Report
- Google AI Studio Documentation
- Vertex AI Gemini Documentation
- DeepMind Blog Posts (2023-2026)
Wikidata: Q116698014 · Zuletzt geprüft: 2026-07-02