DeepFloyd, un grupo de investigación respaldado por Stability AI, ha presentado DeepFloyd IF, un modelo de conversión de texto en imagen capaz de integrar texto en imágenes. Entrenado con un conjunto de datos de más de mil millones de imágenes y texto, DeepFloyd IF puede crear una imagen a partir de una indicación, como un osito de peluche con una camiseta en la que se lee Deep Floyd’ opcionalmente en una gama de estilos. DeepFloyd IF utiliza varios procesos diferentes apilados en una arquitectura modular para generar imágenes. El modelo es particularmente bueno entendiendo indicaciones complejas e incluso relaciones espaciales descritas en indicaciones. Es capaz de generar texto legible y correctamente escrito en las imágenes, e incluso de entender indicaciones en varios idiomas. Se espera que DeepFloyd IF abra una oleada de nuevas posibilidades de arte generativo, como el diseño de logotipos, páginas web, carteles, vallas publicitarias e incluso memes. Sin embargo, el modelo no genera imágenes tan estéticamente agradables como algunos modelos de difusión. También existe la posibilidad de que el modelo presente sesgos, ya que es probable que los textos y las imágenes de comunidades y culturas que utilizan otros idiomas no se tengan suficientemente en cuenta. DeepFloyd IF, al igual que otros modelos generativos de código abierto, podría utilizarse para hacer daño, como generar deepfakes de famosos pornográficos y representaciones gráficas de violencia.
