deep-floyd/IF

Laboratórium DeepFloyd v spoločnosti StabilityAI predstavilo DeepFloyd IF, model s otvoreným zdrojovým kódom na prevod textu na obraz, ktorý generuje fotorealistické obrázky na základe textových podnetov. Model sa skladá z kodéra zmrazeného textu a troch kaskádových modulov pixelovej difúzie, ktoré generujú obrázky so zvyšujúcim sa rozlíšením. Model využíva kodér zmrazeného textu založený na transformátore T5 na extrakciu textových embeddingov, ktoré sa potom vkladajú do architektúry UNet rozšírenej o krížovú pozornosť a združovanie pozornosti. Model prekonáva súčasné najmodernejšie modely a na súbore údajov COCO dosahuje skóre FID s nulovým počtom snímok 6,66. Model je vysoko efektívny a na jeho používanie je potrebných minimálne 16 GB pamäte vRAM. Model je k dispozícii na použitie v režimoch Dream, Style Transfer, Super Resolution a Inpainting. Model je integrovaný s knižnicou Hugging Face Diffusers, ktorá používateľom umožňuje prispôsobiť proces generovania obrazu a ľahko kontrolovať medzivýsledky. Modely dostupné v tejto databáze kódu majú známe obmedzenia a odchýlky a kód je uvoľnený pod vlastnou licenciou. Tvorcami DeepFloyd IF sú Alex Shonenkov, Misha Konstantinov, Daria Bakshandaeva, Christoph Schuhmann, Ksenia Ivanova a Nadiia Klokova. Model bol vycvičený s neoceniteľnou podporou spoločnosti StabilityAI a jej generálneho riaditeľa Emada Mostaqueho, tímov LAION a Huggingface.

celý článok

Pridaj komentár