DALL-E (OpenAI)
Text-zu-Bild-Generierungs-Modell von OpenAI, das Bilder aus natürlichsprachlichen Beschreibungen erzeugt und in ChatGPT sowie der OpenAI-API verfügbar ist.
Definition
DALL-E ist das Text-zu-Bild-Generierungs-Modell von OpenAI, das im Januar 2021 erstmals vorgestellt wurde. Der Name kombiniert den surrealistischen Künstler Salvador Dalí mit dem Pixar-Roboter WALL-E und unterstreicht den Anspruch, sowohl künstlerisch kreativ als auch technisch zugänglich zu sein. DALL-E erzeugt aus natürlichsprachlichen Beschreibungen (Prompts) Bilder in beliebigem Stil, von photorealistisch über Comic bis Ölgemälde, und ist in ChatGPT sowie über die OpenAI-API verfügbar.
Die DALL-E-Linie hat den breiten Durchbruch von generativer Bild-KI massgeblich geprägt. DALL-E 2 (April 2022) war eines der ersten öffentlich zugänglichen Text-zu-Bild-Tools mit hoher Qualität, DALL-E 3 (Oktober 2023) brachte präzises Prompt-Following in den Massenmarkt. 2025 hat OpenAI mit nativer GPT-4o-Bildgenerierung den nächsten Schritt vollzogen, der DALL-E in vielen Anwendungen ablöst.
Architektur
Die DALL-E-Architektur hat sich über die Versionen deutlich verändert:
- DALL-E 1 (2021): Autoregressiver Transformer, der nach Text-Tokens visuelle Tokens vorhersagt. Bilder werden über einen VQ-VAE in diskrete Tokens überführt und vom Transformer Token für Token erzeugt.
- DALL-E 2 (2022): Wechsel auf Diffusion Models. Zwei Komponenten: Ein Prior-Modell wandelt Text-Embeddings (via CLIP) in Bild-Embeddings um, ein Decoder-Modell entrauscht zufälliges Rauschen in ein Bild, gesteuert vom Bild-Embedding.
- DALL-E 3 (2023): Verbessertes Diffusion-Modell mit massivem Sprung in Prompt-Following. Schlüssel-Innovation: GPT-4 verfeinert den Original-Prompt automatisch zu detaillierteren, längeren Beschreibungen, was die Bild-Treue zur Intention deutlich erhöht.
- GPT-4o (2025): Native Bildgenerierung im Sprachmodell selbst, ohne separates Diffusion-Modell. Die Architektur ist nicht öffentlich, dürfte aber autoregressive Bild-Token-Generierung oder einen integrierten Diffusion-Decoder beinhalten.
Die Trainingsdaten umfassen massive Web-Korpora aus Bild-Text-Paaren. Genaue Mengen und Quellen sind nicht öffentlich, was DALL-E rechtlich angreifbar macht und in mehreren Klagen von Künstlern und Bildagenturen thematisiert wird.
Praxis
DALL-E ist auf mehreren Kanälen verfügbar:
- ChatGPT: Direkte Integration in der Konversation, Bilder werden durch natürliche Anfragen erzeugt und können iterativ verfeinert werden.
- OpenAI API: Image Generation Endpoint mit DALL-E 3 und GPT-4o, Preise von 0.04 bis 0.12 Dollar pro Bild je nach Auflösung und Qualität.
- Microsoft Designer und Copilot: DALL-E-Integration in Microsofts Ökosystem, oft mit kostenlosem Tages-Kontingent.
- Adobe Firefly App: seit 2025 lässt Adobe in der Firefly-App auch externe Modelle zu, darunter das OpenAI-Bildmodell. Photoshop und Express nutzen dagegen Adobes eigene Firefly-Modelle.
Typische Anwendungen umfassen Marketing-Assets, Blog-Illustrationen, Storyboard-Erstellung, Produkt-Mockups, Konzept-Art und Bildung. Profis nutzen DALL-E oft als ersten Schritt für schnelle Ideen-Iteration, gefolgt von manueller Verfeinerung in Photoshop oder spezialisierten Tools.
Häufige Fehler
- Vague Prompts: Kurze Beschreibungen liefern generische Resultate. Konkrete Stil-Vorgaben ("Ölgemälde im Stil von 1890"), Komposition ("Vogelperspektive, Weitwinkel") und Stimmung ("warmes Abendlicht") erhöhen die Treffer-Quote drastisch.
- Text-im-Bild überschätzen: DALL-E 3 ist beim Rendern von Text deutlich besser als Vorgänger, aber immer noch fehleranfällig bei langen Wörtern und mehreren Zeilen. GPT-4o-Bildgenerierung ist hier deutlich überlegen.
- Promi-Gesichter und Marken testen: OpenAI blockiert prominent geschützte Inhalte. Versuche zur Umgehung führen zu Warnungen und potenziell zu Account-Sanktionen.
- Copyright überschätzen: KI-generierte Bilder werden vom US Copyright Office grundsätzlich nicht geschützt. Für kommerzielle Nutzung ist die OpenAI-Lizenz ausreichend, aber Markenschutz gegen Dritte ist nicht durchsetzbar.
- C2PA-Metadaten entfernen: OpenAI fügt Provenienz-Metadaten ein, die zeigen, dass das Bild KI-generiert ist. Entfernen dieser Metadaten ist technisch möglich, aber ethisch problematisch und teils gesetzlich reguliert.
Abgrenzung
- Midjourney: Hauptkonkurrent, ästhetisch oft überlegen, eigenes Discord-Interface, schwächeres Prompt-Following bei komplexen Szenen.
- Stable Diffusion (Stability AI): Open-Source-Konkurrent, maximale Kontrolle und Customizing, lokal lauffähig, niedrigere Qualität out of the box.
- Imagen 3 (Google): vergleichbare Qualität, in Google-Produkte integriert, weniger zugänglich für Endnutzer.
- FLUX.1 (Black Forest Labs): 2024 erschienener Open-Weight-Konkurrent mit DALL-E-3-Niveau, schnell verbreitet.
- GPT-4o-Bildgenerierung: OpenAIs eigener Nachfolger, technisch separate Architektur, deckt zunehmend DALL-E-Anwendungen ab.
- Diffusion Models allgemein: die zugrundeliegende Klasse von Generativen Modellen, zu der DALL-E 2 und 3 sowie Stable Diffusion gehören.
Weiter im KI-Lexikon
← Zurück zum LexikonHäufige Fragen
Was ist DALL-E?+
DALL-E ist das Text-zu-Bild-Generierungs-Modell von OpenAI, das im Januar 2021 erstmals vorgestellt wurde. Der Name ist eine Verschmelzung des Künstlers Salvador Dalí und des Pixar-Roboters WALL-E. DALL-E erzeugt aus natürlichsprachlichen Beschreibungen (Prompts) Bilder in beliebigem Stil und ist in ChatGPT sowie über die OpenAI-API verfügbar.
Welche DALL-E-Versionen gibt es?+
DALL-E 1 (Januar 2021, Forschungs-Demo), DALL-E 2 (April 2022, deutlich höhere Qualität, breit zugänglich), DALL-E 3 (Oktober 2023, in ChatGPT integriert, drastisch besseres Prompt-Following). 2025 hat OpenAI mit GPT-4o native Bildgenerierung im Sprachmodell selbst eingeführt, was DALL-E 3 in vielen Anwendungen ablöst.
Wie funktioniert DALL-E technisch?+
DALL-E 1 nutzte einen autoregressiven Transformer, der Bild-Tokens nach Text-Tokens vorhersagt. DALL-E 2 und 3 nutzen Diffusion Models: zufälliges Rauschen wird in mehreren Schritten zu einem Bild entrauscht, gesteuert von Text-Embeddings aus CLIP oder einem GPT-Modell. DALL-E 3 nutzt GPT-4 zur automatischen Prompt-Verfeinerung.
Was kostet DALL-E in der API?+
DALL-E 3 kostet 0.04 Dollar pro Standard-Bild (1024×1024) und 0.08 Dollar pro HD-Bild. Querformatige und hochformatige Varianten (1792×1024) liegen bei 0.08 Dollar Standard und 0.12 HD. In ChatGPT Plus, Team und Enterprise ist DALL-E ohne zusätzliche Kosten enthalten, allerdings mit Tages-Limits.
Was kann DALL-E besser als Midjourney oder Stable Diffusion?+
DALL-E 3 folgt komplexen Text-Prompts deutlich präziser als die Konkurrenz, vor allem bei Text-im-Bild, mehreren Objekten und spezifischen Komposition-Vorgaben. Midjourney ist ästhetisch oft überlegen, Stable Diffusion bietet mehr Kontrolle und Open-Source-Anpassbarkeit. DALL-E ist die zugänglichste Variante über ChatGPT.
Welche Sicherheits-Limits hat DALL-E?+
DALL-E lehnt Anfragen mit Gewalt, sexuellen Inhalten, Promi-Gesichtern (mit wenigen Ausnahmen) und politischen Persönlichkeiten ab. Markenlogos und urheberrechtlich geschützte Charaktere sind ebenfalls blockiert. Bilder werden mit C2PA-Metadaten und unsichtbaren Wasserzeichen markiert, um KI-Generierung nachvollziehbar zu machen.
Kann ich DALL-E-Bilder kommerziell nutzen?+
Ja, OpenAI gewährt Nutzungsrechte für mit DALL-E erzeugte Bilder, einschliesslich kommerzieller Nutzung. Urheberrechtlicher Schutz für KI-generierte Bilder ist juristisch umstritten, das US Copyright Office gewährt grundsätzlich keinen Schutz für rein KI-erzeugte Werke ohne wesentlichen menschlichen Beitrag.
Was ist GPT-4o-Bildgenerierung im Vergleich?+
GPT-4o (seit März 2025 mit nativer Bildgenerierung) erzeugt Bilder direkt im Sprachmodell, ohne separates Bild-Modell. Das ermöglicht bessere Text-im-Bild-Qualität, präzise Kompositionen und konsistente Charaktere über mehrere Bilder. OpenAI positioniert GPT-4o als langfristigen Nachfolger von DALL-E.
Verwandte Begriffe
Quellen
- Ramesh et al. (2021) Zero-Shot Text-to-Image Generation
- Ramesh et al. (2022) Hierarchical Text-Conditional Image Generation with CLIP Latents
- OpenAI DALL-E 3 System Card
- OpenAI Image Generation API Documentation
Wikidata: Q105078662 · Zuletzt geprüft: 2026-07-02