Rubicap : l’ia d’apple surpasse les grands modèles d’images

À retenir :
– RubiCap est un framework développé par Apple et l’université du Wisconsin-Madison.
– Il produit des modèles de description d’image détaillée avec jusqu’à 7 milliards de paramètres.
– Le modèle RubiCap-3B dépasse le modèle RubiCap-7B sur certains benchmarks.
– RubiCap améliore la recherche visuelle et les outils d’accessibilité grâce à des descriptions précises.
– Il utilise une méthode originale pour évaluer et corriger ses performances.


RubiCap : la nouvelle IA compacte d’Apple pour la description d’images

Des chercheurs travaillant pour Apple et l’université du Wisconsin-Madison ont développé RubiCap, un cadre innovant qui permet de créer des modèles de description d’image détaillée comprenant entre 2 et 7 milliards de paramètres. Étonnamment, ces modèles parviennent à surpasser même ceux ayant jusqu’à 72 milliards de paramètres. Un résultat frappant est que le modèle avec 3 milliards de paramètres (3B) surpasse le modèle avec 7 milliards (7B) dans plusieurs tests.

Rubicap : l'ia d'apple surpasse les grands modèles d'images
La description d’image détaillée va au-delà d’une simple légende globale ; elle consiste à identifier et décrire avec précision chaque région et élément présent dans une image. Cette capacité est essentielle non seulement pour former des modèles d’intelligence artificielle en matière de vision-langage et de génération d’images, mais aussi pour perfectionner la recherche visuelle ainsi que les outils destinés à améliorer l’accessibilité.

Rubicap : l'ia d'apple surpasse les grands modèles d'images
Deux défis majeurs se posent ici : produire des annotations expertes à grande échelle s’avère coûteux, tandis que l’apprentissage par renforcement n’a jamais vraiment connu le succès sur des tâches telles que le sous-titrage, en raison du manque de critères d’évaluation objectifs.

Rubicap : l'ia d'apple surpasse les grands modèles d'images
Pour résoudre ces problèmes, RubiCap utilise une approche novatrice. En utilisant un ensemble de données comprenant 50 000 images issues des projets PixMoCap et DenseFusion-4V-100K, divers grands modèles existants tels que Gemini 2.5 Pro, GPT-5 et Qwen2.5-VL-72B-Instruct génèrent chacun leur propre description pour chaque image analysée parallèlement par le modèle IA développé par Apple. Ensuite, Gemini 2.5 Pro examine toutes les descriptions fournies ainsi que les images elles-mêmes afin d’identifier les similitudes et les manques avant d’extraire des critères évaluatifs structurés.

Rubicap : l'ia d'apple surpasse les grands modèles d'images
C’est alors que Qwen2.5-7B-Instruct attribue une note à chaque description selon ces critères établis afin de générer un signal de récompense utilisé durant l’entraînement du modèle. Ce processus offre ainsi un retour précis sur ce qu’il doit corriger sans dépendre uniquement d’une réponse prédéfinie.

Au cours du benchmark CapArena, RubiCap-7B a affiché le taux de victoire le plus élevé parmi tous les modèles testés – y compris ceux comportant respectivement jusqu’à 72 ou 32 milliards de paramètres – tout en maintenant également le taux hallucinatoire le plus bas. Sur CaptionQA, ce même modèle atteint une efficacité lexicale équivalente à celle du Qwen2.5-VL-32B-Instruct tandis qu’il est intéressant de noter que le modèle 3B dépasse son homologue supérieur en termes qualitatifs lorsque utilisé comme générateur descriptif.

Pour l’heure, on ignore comment Apple prévoit d’intégrer RubiCap dans ses appareils tels que l’iPhone, l’iPad ou encore Mac ; il faudra donc attendre davantage pour découvrir leurs intentions précises concernant cette technologie prometteuse.

Avatar photo

Soqa

Grand maitre Goa'uld des dessins animés, j'ai beaucoup aidé sur l'ancienne version du site de 2002 et je reviens filer un coup de main quand j'ai du temps.

12 commentaires sur “Rubicap : l’ia d’apple surpasse les grands modèles d’images

Laisser un commentaire