Apple dévoile une ia pour générer sons et voix à partir de vidéos muettes

À retenir :
– développement du modèle VSSFlow par apple
– génération unifiée de sons et paroles
– meilleures performances que les modèles spécialisés
– application possible pour la postproduction vidéo
– code source ouvert sur github


Apple s’engage dans le développement d’une intelligence artificielle innovante capable de recréer des sons et des voix à partir de vidéos muettes. Des chercheurs associés à la marque ont récemment présenté VSSFlow, un modèle d’IA qui génère à la fois des effets sonores et de la parole en utilisant simplement des vidéos dépourvues de son. Cette avancée représente une rupture par rapport aux méthodes traditionnelles qui traitent séparément la synthèse vocale et les sons d’ambiance, souvent avec des résultats limités.

VSSFlow a été conçu par trois ingénieurs d’Apple en collaboration avec six chercheurs de l’université Renmin en Chine. Ce modèle repose sur une architecture commune, permettant ainsi à l’apprentissage vocal d’améliorer la génération sonore, et vice versa. « L’entraînement conjoint ne dégrade pas les performances, il les renforce », soulignent les auteurs dans leur étude.

Apple dévoile une ia pour générer sons et voix à partir de vidéos muettes
Le système utilise plusieurs techniques avancées pour générer du son, intégrant notamment la conversion de textes en séquences phonétiques ainsi que des méthodes pour reconstruire des sons à partir de bruit aléatoire. Le résultat est une IA capable non seulement de produire dialogues et effets sonores correspondant aux images, mais ce, dans un seul flux opérationnel. De plus, il est envisageable d’intégrer ces dialogues pour les personnages qui interagissent à l’écran.

Lors des tests effectués, VSSFlow a démontré une performance équivalente voire supérieure par rapport aux modèles habituels spécialisés dans une tâche unique tout en offrant une solution unifiée plus facile à déployer. Les chercheurs ont également fourni des démonstrations comparatives et rendu le code source accessible sur GitHub.

Cette technologie pourrait révolutionner divers domaines tels que la postproduction vidéo, l’accessibilité du contenu ou encore le processus créatif immersif. Elle permettrait notamment de donner vie automatiquement à des archives muettes ou à des séquences enregistrées sans son direct. Avec cette initiative, Apple franchit une nouvelle étape dans sa quête autour de l’intelligence artificielle générative appliquée au secteur audiovisuel

Avatar photo

Hyunkel

Très gros fan de Dragon Quest Dai no Daiboken, de jeux vidéo et de bière. 1 par 1 ou tout en même temps, ça dépend des jours.

9 commentaires sur “Apple dévoile une ia pour générer sons et voix à partir de vidéos muettes

Laisser un commentaire