Alibaba’s Institute for Intelligent Computing vyvinul systém umelej inteligencie s názvom EMO, ktorý dokáže animovať jednu portrétovú fotografiu a generovať realistické hovoriace alebo spievajúce videá. Systém využíva prístup priamej syntézy zvuku do videa, čím obchádza potrebu 3D modelov alebo orientačných bodov tváre. Systém EMO využíva difúzny model a bol vycvičený na súbore údajov obsahujúcom viac ako 250 hodín videí s hovoriacimi hlavami. Prekonáva existujúce metódy z hľadiska kvality videa, zachovania identity a expresivity. EMO dokáže generovať aj spievajúce videá s vhodnými tvarmi úst a výrazmi tváre. Systém dokáže vytvárať videá s ľubovoľnou dĺžkou trvania na základe dĺžky vstupného zvuku. Pretrvávajú však etické obavy týkajúce sa možného zneužitia tejto technológie. Výskumníci plánujú preskúmať metódy na detekciu syntetických videí.
