À retenir : – Ferret-UI Lite est un modèle IA local conçu pour fonctionner sur l’appareil. – Il a seulement 3 milliards de paramètres mais égalise ou dépasse des modèles concurrents beaucoup plus gros. – Ferret-UI Lite utilise une technique de recadrage et de zoom à la volée pour améliorer ses prédictions. – Un système multi-agents génère des données d’entraînement synthétiques en direct pour affiner les performances. – L’exécution locale garantit la confidentialité des utilisateurs sans transmission de données aux serveurs.
Apple a récemment partagé une étude sur Ferret-UI Lite, une version simplifiée de sa gamme de modèles Ferret-UI, conçue pour fonctionner directement sur les appareils. Avec seulement 3 milliards de paramètres, ce modèle d’intelligence artificielle rivalise avec des agents d’interface graphique concurrents qui peuvent comporter jusqu’à 24 fois plus de paramètres. La série des modèles Ferret est apparue en décembre 2023, grâce à l’équipe de neuf chercheurs qui avaient présenté un modèle multimodal capable d’interpréter des références en langage naturel dans des zones spécifiques d’une image. Par la suite, Apple a élargi cette base avec Ferret-UI (comportant 13 milliards de paramètres et spécialisé dans les interfaces mobiles à résolution fixe), puis avec Ferret-UI 2 (multi-plateformes et haute résolution).
Avec Ferret-UI Lite, Apple adopte une nouvelle approche : contrairement à ses prédécesseurs qui s’appuyaient sur la puissance des serveurs, ici l’intelligence artificielle privilégie l’exécution locale. Cependant, cette méthode rencontre un obstacle bien connu : les agents d’interface graphique efficaces reposent généralement sur de grands modèles situés côté serveur capables d’effectuer un raisonnement complexe et une planification multi-étapes. Malheureusement, ces modèles sont souvent trop lourds pour être exécutés directement sur un appareil mobile ou un ordinateur portable.
Les chercheurs identifient quatre catégories de tâches que ces agents doivent maîtriser en même temps : l’interaction agentique avec les interfaces graphiques, la compréhension du contenu affiché à l’écran, la planification multi-étapes ainsi que la capacité à corriger en temps réel. Pour parvenir à résoudre ces défis avec un modèle comptant seulement 3 milliards de paramètres, deux approches techniques distinctes ont été mises au point.
La première technique consiste en un système dynamique de recadrage et de zoom. Ferret-UI Lite réalise une prédiction initiale sur l’intégralité de l’écran avant d’identifier la zone pertinente ; il recadre alors autour d’elle pour effectuer une seconde prédiction uniquement dans cette région ciblée. Ce processus en deux étapes permet au modèle petit format de compenser sa limitation face à plusieurs éléments visuels différemment complexes : plutôt que tout traiter simultanément, il concentre progressivement son attention là où c’est nécessaire.
Le second aspect est particulièrement prometteur pour le futur : il s’agit du système auto-générateur pour créer des données d’entraînement. Les chercheurs ont mis en place un ensemble complexe composé de plusieurs agents interagissant directement avec des interfaces graphiques réelles afin produire efficacement des exemples synthétiques à grande échelle. Ce système repose sur quatre agents distincts : le premier propose progressivement des tâches pédagogiques adaptées ; le deuxième décompose celles-ci en étapes réalisables ; le troisième exécute concrètement chaque étape; tandis qu’un quatrième agent critique évalue la qualité finale du résultat obtenu.
Ce qui différencie ce système par rapport aux méthodes traditionnelles utilisant des données annotées manuellement réside dans sa capacité unique à saisir toute la complexité du monde réel – erreurs potentielles incluses – ainsi que les diverses situations inattendues rencontrées par les utilisateurs au quotidien.
Cependant, certaines limites existent concernant ce nouveau modèle et ses implications concernant la confidentialité. À cet égard,Ferret-UI Lite a été évalué sous divers environnements tels qu’Android ,Web ou encore PC ,à travers les benchmarks AndroidWorld et OSWorld . Cette orientation contraste avec celle observée précédemment centrée exclusivement autour iOS , probablement dû au fait qu’il est plus facile obtenir accès test reproductibles larges échelles visant plateformes mentionnées .
Il convient également noter qu’en dépit dess limites identifiées lors traitements impliquant multiples étapes successives;modèle IA offre garantie solide niveau confidentialité: aucune donnée n’est envoyée vers serveurs externes ,l’agent travaillant localement afin interagir applications disponibles sans lien réseau requis