Stable Diffusion ist ein Open-Source-KI-Modell zur Generierung von Bildern aus Texteingaben. Das 2022 von Stability AI veröffentlichte Tool hebt sich von Diensten wie Midjourney und DALL-E durch freie Nutzung und die lokale Installation auf dem eigenen Computer ab.
Hauptfunktionen
Text-zu-Bild-Generierung mit mehreren Stilen, darunter Fotorealismus, Anime und digitale Kunst
Inpainting zum Ersetzen oder Bearbeiten von Objekten in einem vorhandenen Bild
Outpainting zum Erweitern eines Bildes und automatischen Auffüllen des Hintergrunds
ControlNet für die generation mit Skizzen und 3D-Referenzen
LoRA-„Mikromodelle“ für schnelles Styling ohne hohen VRAM-Bedarf
Seed-Locking, um kontrollierte Variationen desselben Bildes zu erstellen
Stable Diffusion verarbeitet Eingaben auf Russisch ebenso wie auf Englisch. Version 3 verbessert die Detailgenauigkeit und stellt Text in Bildern präziser dar.
Nutzung und Installation
Sie können Stable Diffusion online oder lokal ausführen. Für die lokale Einrichtung sind in der Regel eine GPU mit 4+ GB VRAM und etwa 15 GB freier Speicherplatz erforderlich.
Online: DreamStudio (kostenpflichtig, ab 10 $ pro 1.000 Credits), Hugging Face (kostenlos, aber langsamer), Playground AI (unbegrenzt mit Wasserzeichen)
Lokal: Automatic1111 (beliebte Weboberfläche), ComfyUI (node-basiertes Workflow-System, oft für AMD bevorzugt), Easy Diffusion 3.0 (vereinfachtes Installationsprogramm)
Technische Hinweise
Trainiert mit 5 Milliarden Bildern
Läuft auf NVIDIA-, AMD- und Intel-GPUs
Generiert ein Bild in etwa 5–30 Sekunden
Unterstützt Auflösungen bis zu 2048×2048
500 Community-Anpassungen
Erlaubt kommerzielle Nutzung

