À retenir : – développement du modèle VSSFlow par apple – génération unifiée de sons et paroles – meilleures performances que les modèles spécialisés – application possible pour la postproduction vidéo – code source ouvert sur github
Apple s’engage dans le développement d’une intelligence artificielle innovante capable de recréer des sons et des voix à partir de vidéos muettes. Des chercheurs associés à la marque ont récemment présenté VSSFlow, un modèle d’IA qui génère à la fois des effets sonores et de la parole en utilisant simplement des vidéos dépourvues de son. Cette avancée représente une rupture par rapport aux méthodes traditionnelles qui traitent séparément la synthèse vocale et les sons d’ambiance, souvent avec des résultats limités.
VSSFlow a été conçu par trois ingénieurs d’Apple en collaboration avec six chercheurs de l’université Renmin en Chine. Ce modèle repose sur une architecture commune, permettant ainsi à l’apprentissage vocal d’améliorer la génération sonore, et vice versa. « L’entraînement conjoint ne dégrade pas les performances, il les renforce », soulignent les auteurs dans leur étude.
Le système utilise plusieurs techniques avancées pour générer du son, intégrant notamment la conversion de textes en séquences phonétiques ainsi que des méthodes pour reconstruire des sons à partir de bruit aléatoire. Le résultat est une IA capable non seulement de produire dialogues et effets sonores correspondant aux images, mais ce, dans un seul flux opérationnel. De plus, il est envisageable d’intégrer ces dialogues pour les personnages qui interagissent à l’écran.
Lors des tests effectués, VSSFlow a démontré une performance équivalente voire supérieure par rapport aux modèles habituels spécialisés dans une tâche unique tout en offrant une solution unifiée plus facile à déployer. Les chercheurs ont également fourni des démonstrations comparatives et rendu le code source accessible sur GitHub.
Cette technologie pourrait révolutionner divers domaines tels que la postproduction vidéo, l’accessibilité du contenu ou encore le processus créatif immersif. Elle permettrait notamment de donner vie automatiquement à des archives muettes ou à des séquences enregistrées sans son direct. Avec cette initiative, Apple franchit une nouvelle étape dans sa quête autour de l’intelligence artificielle générative appliquée au secteur audiovisuel
Génial cette invention, je vais pouvoir mettre un son sur ma vidéo où mon chat fait la tête aux voisins !! 😂
Un projet ambitieux encore une fois d’Apple mais est-ce que c’est vraiment utile dans le quotidien des gens ?
C’est ouf! S’ils arrivent à faire parler mes vieilles vidéos de vacances sans son, je suis fan direct!
Si ça continue comme ça, je vais me retrouver à avoir peur du silence… Vivement les bruitages pour mes siestes ! 😂
Je suis désolé mais j’accroche pas du tout. On dirait que c’est juste un gadget qui ne servira à rien dans la vraie vie
Mais lol ! Qui a vraiment besoin d’un truc pareil ? On va bientôt devoir payer des droits d’auteur pour le bruit de nos bouchons de bouteilles !
Franchement, je comprends pas l’intérêt de faire des sons pour des vidéos muettes. Ça fait un peu gadget, non ?
C’est incroyable ce que Apple fait avec cette IA ! J’ai hâte de voir comment ça va changer notre manière de créer du contenu vidéo
VSSFlow, c’est une super avancée technologique. Qui aurait cru qu’on pourrait donner vie à des vidéos muettes comme ça ? Bravo Apple !