Stable Diffusion
Open-Source-Diffusion-Modell für Bildgenerierung, das Stability AI 2022 veröffentlichte und das die offene KI-Bildgenerierung breit zugänglich gemacht hat. Latent Diffusion auf CLIP-Conditioning.
Definition
Stable Diffusion ist eine Familie offener Diffusion-Modelle zur Bildgenerierung, die Stability AI gemeinsam mit der CompVis-Gruppe der LMU München und RunwayML im August 2022 veröffentlichte. Das Modell basiert auf Latent Diffusion und nutzt CLIP-Text-Embeddings als Conditioning. Der entscheidende Beitrag war nicht primär die Modellqualität (DALL-E 2 und Imagen waren technisch ebenbürtig), sondern die offene Veröffentlichung der Gewichte unter einer permissiven Lizenz und die Lauffähigkeit auf Consumer-GPUs.
Damit löste Stable Diffusion eine Welle an Innovationen aus: tausende Community-Finetunes, LoRA-Adapter, ControlNet, IP-Adapter, DreamBooth, AnimateDiff und viele weitere Erweiterungen. Stable Diffusion wurde zur Plattform, auf der die offene Generative-AI-Community ihre Tools, Workflows und Standards entwickelte.
Architektur und Mechanismus
Stable Diffusion ist ein Latent Diffusion Model (LDM) nach Rombach et al. 2022. Drei Hauptkomponenten:
- VAE (Variational Autoencoder): Komprimiert ein RGB-Bild (z. B. 512x512x3) in einen Latent-Tensor (z. B. 64x64x4). Diese 48-fache Kompression reduziert Rechen- und Speicherkosten dramatisch. Beim Sampling dekodiert der VAE den finalen Latent zurück in Pixel.
- U-Net Denoiser: Klassisches U-Net mit Residual Blocks, Self-Attention und Cross-Attention auf Text-Embeddings. Im SDXL deutlich grösser, in SD3 durch Diffusion Transformer (MMDiT) ersetzt.
- Text Encoder (CLIP): Wandelt den Prompt in Embeddings um. SD 1.5 nutzt CLIP-ViT-L. SDXL nutzt CLIP-ViT-L und OpenCLIP-ViT-bigG parallel. SD3 nutzt CLIP-L, CLIP-G und T5-XXL kombiniert.
Training erfolgt durch Hinzufügen von Gauss-Rauschen zu Latents in mehreren Schritten und Lernen, dieses Rauschen zu prognostizieren. Beim Sampling wird vom puren Rauschen iterativ denoised, geleitet von CLIP-Embeddings und einem Classifier-Free-Guidance-Mechanismus (CFG-Scale).
Wichtige Sampling-Methoden sind DDIM, DPM-Solver++, Euler, LMS, UniPC und LCM/Turbo für One-Step-Sampling. Typische Sampling-Schritte: 20 bis 50 für klassische Modelle, 1 bis 4 für SDXL Turbo und SD3.5 Turbo.
Praxis und Anwendung
Stable Diffusion treibt eine enorme Bandbreite von Anwendungen:
- Design und Werbung: Mood Boards, Konzept-Visuals, Banner, Social-Media-Posts.
- Concept Art: Spiele- und Filmindustrie nutzen SD für frühe Visualisierungen, oft kombiniert mit ControlNet.
- E-Commerce: Produktdarstellungen, Modelle in unterschiedlichen Stilen, Hintergrundgenerierung.
- Architektur und Innenarchitektur: Variation von Räumen, Materialvariationen, Sketch-to-Render.
- Mode: Virtuelle Try-Ons, Stilvariationen, Editorial-Visuals.
- Persönliche Avatare: DreamBooth- und LoRA-Finetunes auf Personen.
- Wissenschaft: Visualisierung von Molekülen, Geowissenschaften, Medizin.
- Hobby und Community: CivitAI hostet hunderttausende Community-Modelle, LoRAs, Embeddings.
Tools im Ökosystem: AUTOMATIC1111 WebUI, ComfyUI (Node-basierter Workflow), Forge, InvokeAI, Diffusers (HuggingFace), Stability Matrix, Fooocus. Cloud-Hosting via Replicate, Runpod, Modal oder direkt bei Stability AI.
Häufige Fehler
- Schwache Prompts: Stichwort-Stacking ohne Struktur liefert mittelmässige Ergebnisse. Kamera, Stil, Beleuchtung, Komposition und Künstler-Referenzen explizit nennen.
- Falsche CFG-Scale: Werte unter 5 erzeugen unrelated Outputs, Werte über 12 verbrennen Details. Sweet Spot je nach Modell 6 bis 8.
- Veraltete Version nutzen: SD 1.5 ist 2026 deutlich unter State-of-the-Art. SDXL, SD3.5 oder FLUX nutzen.
- VAE-Mismatch: Manche Finetunes brauchen spezifische VAEs. Falscher VAE führt zu Farbverschiebungen oder Artefakten.
- Lizenz ignorieren: Kommerzielle Nutzung von SD3.5 erfordert Lizenz oberhalb gewisser Umsatzgrenzen. Vorher prüfen.
- Sicherheits-Filter überschätzen: Open-Weight-Modelle können trivial entfilstert werden. Wer Schutz braucht, muss eigene Pipelines bauen.
- Übergewicht auf einen Stil-LoRA: Stack von zu vielen LoRAs zerstört Bildqualität. Maximal 2 bis 3 LoRAs gleichzeitig mit moderaten Gewichten.
Abgrenzung
- DALL-E 3 (OpenAI): Proprietär, integriert in ChatGPT, oft bessere Prompt-Treue und Textdarstellung, weniger anpassbar.
- Midjourney: Proprietär, sehr starke Ästhetik, schwächere Kontrollierbarkeit, kein offizielles API.
- Google Imagen 3 und 4: Proprietär, integriert in Google-Produkte, starke Textdarstellung.
- FLUX.1 (Black Forest Labs): Offenes Modell von Ex-Stability-Forschern, übertrifft SD3 in vielen Benchmarks und ist 2026 die offene Alternative der Wahl.
- Adobe Firefly: Trainiert auf Adobe Stock, kommerziell freigegeben, integriert in Photoshop und Illustrator.
- Ideogram: Stark bei Textdarstellung und Typografie in Bildern.
- GAN-Modelle (StyleGAN, BigGAN): Vorgänger-Paradigma, scharf und schnell, aber begrenzt in Vielfalt und Conditioning.
- Sora und Video-Modelle: Erweitern die Diffusion-Idee auf Zeit-Dimension, andere Architektur (DiT statt U-Net).
Weiter im KI-Lexikon
← Zurück zum LexikonHäufige Fragen
Was ist Stable Diffusion?+
Stable Diffusion ist eine Familie offener Diffusion-Modelle zur Bildgenerierung, die Stability AI in Kooperation mit CompVis (LMU München) und RunwayML im August 2022 veröffentlichte. Es war das erste leistungsfähige Text-zu-Bild-Modell mit offen verfügbaren Gewichten und liess sich auf Consumer-GPUs ausführen, was die offene KI-Bildgenerierung breit zugänglich machte.
Wie funktioniert Stable Diffusion?+
Stable Diffusion ist ein Latent Diffusion Model: das Bild wird via VAE in einen kompakten Latent Space komprimiert, in dem ein U-Net iterativ verrauschte Latents denoised, geleitet durch CLIP-Text-Embeddings. Nach dem Denoising dekodiert der VAE das Latent zurück in ein Pixel-Bild. Diese Latent-Architektur reduziert Rechenkosten dramatisch gegenüber Pixel-Diffusion.
Welche Versionen gibt es?+
Stable Diffusion 1.4 und 1.5 (CompVis und RunwayML, 2022), Stable Diffusion 2.0 und 2.1 (Stability AI, 2022), SDXL (2023, deutlich höhere Qualität), SDXL Turbo (One-Step-Sampling), Stable Diffusion 3 (2024, Diffusion Transformer Architektur), Stable Diffusion 3.5 (2024) und SD-XL-Lightning. Daneben existieren tausende Community-Finetunes.
Was sind LoRA und ControlNet?+
LoRA (Low-Rank Adaptation) sind kleine Adapter-Gewichte (oft unter 200 MB), die ein vortrainiertes Stable Diffusion auf einen Stil, eine Person oder ein Konzept finetunen. ControlNet (Zhang et al. 2023) erlaubt strukturelle Konditionierung via Posen, Kanten, Tiefen-Maps oder Skizzen. Beide haben das Ökosystem um Stable Diffusion massiv erweitert.
Welche Lizenz hat Stable Diffusion?+
Frühere Versionen (SD 1.5, SDXL) wurden unter CreativeML Open RAIL-M lizenziert, mit Nutzungs-Einschränkungen gegen Schaden und Bias. SD3 und SD3.5 nutzen eine Community License mit kostenlosem nicht-kommerziellen Gebrauch und kostenpflichtigem kommerziellen Gebrauch oberhalb gewisser Umsatzgrenzen. Das hat in der Community Kritik ausgelöst.
Wofür wird Stable Diffusion eingesetzt?+
Kreativ-Workflows in Design und Werbung, Concept Art für Games und Film, Mode-Visualisierung, E-Commerce-Asset-Generierung, Architektur-Visualisierung, persönliche Avatar-Generierung, NSFW-Communities (eines der ursprünglichen Treiber-Anwendungen, kontrovers), wissenschaftliche Visualisierung und unzählige Hobby-Anwendungen.
Welche Konkurrenten gibt es?+
OpenAI DALL-E 3 und GPT-4o Image Generation, Google Imagen 3 und 4, Midjourney v6 und v7, Adobe Firefly, Black Forest Labs FLUX.1 (Pro, Dev, Schnell) und Ideogram. FLUX hat 2024 und 2025 in vielen Benchmarks Stable Diffusion überholt und wurde zur offenen Alternative der Wahl.
Welche Limitationen hat Stable Diffusion?+
Schwächen bei präziser Textdarstellung in Bildern (SD3 verbessert das), bei Händen und Anatomie (verbessert sich mit jeder Version), bei räumlicher Logik und Mengen, bei seltenen Konzepten ausserhalb der Trainingsdaten, bei Bias aus Web-Daten und bei Sicherheits-Filtern, die in Open-Weight-Settings einfach umgangen werden können.
Verwandte Begriffe
Quellen
- Rombach et al. 2022 (High-Resolution Image Synthesis with Latent Diffusion Models, CompVis)
- Stability AI Documentation
- Hugging Face Diffusers Library Docs
Wikidata: Q113660857 · Zuletzt geprüft: 2026-06-07