Das Institute for Intelligent Computing von Alibaba hat ein KI-System namens EMO entwickelt, das ein einzelnes Porträtfoto animieren und realistische Sprech- oder Gesangsvideos erzeugen kann. Das System verwendet eine direkte Audio-zu-Video-Synthese, die 3D-Modelle oder Gesichtsmerkmale überflüssig macht. EMO verwendet ein Diffusionsmodell und wurde mit einem Datensatz von über 250 Stunden sprechender Kopfvideos trainiert. Es übertrifft bestehende Methoden in Bezug auf Videoqualität, Identitätserhalt und Ausdruckskraft. EMO kann auch Gesangsvideos mit passenden Mundformen und Gesichtsausdrücken erzeugen. Das System kann Videos von beliebiger Dauer auf der Grundlage der Länge des eingegebenen Tons erzeugen. Es bestehen jedoch weiterhin ethische Bedenken hinsichtlich des möglichen Missbrauchs dieser Technologie. Die Forscher planen, Methoden zur Erkennung synthetischer Videos zu untersuchen.
