À retenir : – ILuvUI est un modèle d’IA capable d’interpréter les interfaces des applications mobiles. – La recherche vise à enseigner aux modèles d’IA la capacité de raisonner sur les interfaces utilisateur. – Des limitations existent dans les modèles vision-langage actuels pour interpréter des environnements structurés. – ILuvUI a montré des performances supérieures après un entraînement spécialisé avec un jeu de données adapté. – Cette technologie promet des avancées en accessibilité et automatisation des tests d’interface.
Apple a récemment présenté ILuvUI, une intelligence artificielle capable de comprendre les interfaces des applications mobiles. Cette innovation est le fruit d’une collaboration avec l’université Aalto en Finlande et ouvre de nouvelles perspectives pour améliorer l’accessibilité et automatiser les tests d’interface, un véritable défi dans le domaine de l’interaction homme-machine.
L’équipe de recherche s’attaque à un problème complexe qui persiste depuis des années : enseigner aux modèles d’intelligence artificielle à raisonner sur les interfaces utilisateur comme le feraient les humains. Pour cela, elle allie compréhension visuelle et sémantique des divers éléments qui composent ces interfaces. En effet, déchiffrer et automatiser les actions liées aux interfaces n’est pas une mince affaire, car des éléments tels que les listes ou les champs de texte comportent plusieurs couches d’informations allant bien au-delà de leur simple fonction.
Bien que certains grands modèles de langage soient très efficaces pour interpréter des instructions en langage naturel, ils négligent souvent la riche information visuelle disponible dans les interfaces. Les chercheurs mettent en lumière une limitation majeure : la plupart des modèles vision-langage sont principalement entraînés sur des images courantes (animaux ou panneaux routiers par exemple), ce qui diminue leurs performances lorsqu’il s’agit d’interpréter des environnements structurés comme ceux que l’on retrouve dans les applications.
Confrontée à ces limitations, l’équipe a choisi d’améliorer LLaVA, un modèle open source existant. Ils ont adapté leur méthode d’entraînement pour se spécialiser dans l’analyse d’interfaces utilisateur. Cette approche ciblée vise à optimiser le modèle afin qu’il soit plus performant sur des tâches spécifiques liées aux applications mobiles. Pour ce faire, ils ont créé un jeu de données synthétiques basé sur quelques exemples variés comprenant interactions Q&R, descriptions détaillées d’écrans ainsi que prévisions d’actions.
Après avoir été formé sur ce jeu de données spécialisé, ILuvUI a affiché des résultats significativement meilleurs comparés à LLaVA dans sa version initiale. Ces améliorations se reflètent non seulement dans divers benchmarks automatisés mais aussi lors de tests auprès de groupes humains. D’ailleurs, ILuvUI présente plusieurs avantages techniques notables : il n’est pas nécessaire de définir une zone spécifique à étudier et il peut traiter autant du texte qu’une image interface.
Les chercheurs chez Apple envisagent plusieurs applications prometteuses pour cette technologie. L’un des domaines prioritaires est sans doute l’accessibilité ; ILuvUI pourrait faciliter la navigation pour ceux ayant besoin d’assistance spécifique. De plus, cette technologie pourrait permettre l’automatisation efficace des tests relatifs aux interfaces.
Bien qu’ILuvUI repose encore sur certains composants open source, il existe un potentiel pour intégrer à terme davantage encodeurs performants tout en améliorant la gestion résolutions et formats compatibles avec différents frameworks existants (comme JSON).
Cette recherche fait partie intégrante du vaste programme mené par Apple autour du potentiel applicatif de l’intelligence artificielle dédiée aux interfaces.Des travaux récents examinent déjà comment anticiper les conséquences diverses associées aux actions effectuées au sein même des applications – capacité complémentaire indispensable au fonctionnement global du projet ILuvUI.
En substance, ILuvUI marque une avancée significative concernant la compréhension interactive via intelligence artificielle appliquée sur nos appareils mobiles.Cette nouveauté pourrait redéfinir notre manière interagir quotidiennement avec nos technologies grâce notamment à son impact positif attendu tant plein accès facilité qu’automatisation intelligente!
Rédacteur en chef de Kame House, Nicolas est un passionné des nouvelles technologies et des jeux vidéos depuis toujours. Roule fièrement en Tesla Model 3 depuis 2022 !