DeepFloyd, eine von Stability AI unterstützte Forschungsgruppe, hat DeepFloyd IF vorgestellt, ein Text-zu-Bild-Modell, das Text in Bilder integrieren kann. DeepFloyd IF wurde auf einem Datensatz mit mehr als einer Milliarde Bildern und Text trainiert und kann aus einer Eingabeaufforderung wie einem Teddybären, der ein Hemd mit der Aufschrift “Deep Floyd” trägt, ein Bild erstellen, wahlweise in verschiedenen Stilen. DeepFloyd IF verwendet mehrere verschiedene Prozesse, die in einer modularen Architektur zusammengefügt sind, um Bilder zu erzeugen. Das Modell ist besonders gut darin, komplexe Aufforderungen und sogar räumliche Beziehungen, die in Aufforderungen beschrieben werden, zu verstehen. Es kann lesbaren und korrekt geschriebenen Text in Bildern erzeugen und sogar Aufforderungen in mehreren Sprachen verstehen. Es wird erwartet, dass DeepFloyd IF eine Welle neuer generativer Kunstmöglichkeiten freisetzen wird, einschließlich Logodesign, Webdesign, Poster, Werbetafeln und sogar Memes. Allerdings erzeugt das Modell keine so ästhetisch ansprechenden Bilder wie einige Diffusionsmodelle. Es besteht auch die Gefahr von Verzerrungen im Modell, da Texte und Bilder aus Gemeinschaften und Kulturen, die andere Sprachen verwenden, wahrscheinlich nicht ausreichend berücksichtigt werden. DeepFloyd IF könnte, wie andere generative Open-Source-Modelle, für schädliche Zwecke verwendet werden, z. B. zur Generierung pornografischer Promi-Depfakes und grafischer Gewaltdarstellungen.
