À retenir : – UniGen-1.5 centralise compréhension, génération et retouche d’images. – L’alignement des instructions améliore la précision des modifications. – Cette IA surpasse plusieurs modèles récents dans les benchmarks. – Des limitations persistent, notamment concernant la cohérence visuelle. – L’apprentissage par renforcement optimise les performances de l’édition.
Apple a récemment présenté UniGen-1.5, une avancée significative dans le domaine de l’intelligence artificielle, visant à centraliser la compréhension, la création et la retouche d’images au sein d’une architecture unique. Ce nouveau système est une évolution du modèle antérieur UniGen, qui avait pour objectif de surmonter les défis liés aux tâches distinctes souvent traitées par des moyens séparés. Avec UniGen-1.5, l’accent est mis sur une amélioration précise de la qualité des modifications visuelles demandées par les utilisateurs.
Cette annonce fait suite aux recherches publiées en mai dernier, où Apple avait déjà dévoilé un grand modèle de langage multimodal (MLLM) capable de comprendre et générer des images sans se reposer sur des systèmes séparés. Les nouvelles capacités d’édition intégrées à UniGen-1.5 représentent donc un pas en avant dans cette direction.
L’unification des compétences de création et d’analyse est un défi technique majeur, car ces deux processus reposent traditionnellement sur des approches très différentes. Cependant, les chercheurs affirment que cette fusion permet au modèle d’utiliser sa capacité de compréhension pour améliorer la qualité des générations visuelles. Cela s’avère crucial pour résoudre un problème fréquent : la difficulté rencontrée par les intelligences artificielles à interpréter parfaitement les instructions complexes relatives à la retouche d’images, surtout lorsque celles-ci impliquent des changements subtils ou spécifiques.
Pour répondre à ce défi de compréhension, l’équipe a introduit une approche novatrice appelée « Alignement des instructions d’édition ». Cette méthode oblige le modèle à formuler en détail une description textuelle du résultat attendu, basée sur l’image originale et les modifications demandées avant même que l’image finale ne soit générée. Comme le soulignent les chercheurs : « Nous proposons l’alignement des instructions d’édition pour améliorer l’alignement entre l’instruction d’édition et la sémantique de l’image cible. » Cette stratégie aide ainsi le système à mieux saisir l’intention derrière chaque modification.
Les chercheurs ont également intégré un apprentissage par renforcement basé sur un système de récompense identique tant pour la génération que pour l’édition. Ce mécanisme est essentiel afin d’harmoniser les performances lors de tâches variées allant du simple ajustement aux transformations complètes.
Bien qu’UniGen-1.5 semble prometteur face à ses concurrents — obtenant notamment 0,89 sur GenEval et 86,83 sur DPG-Bench — il n’est pas exempt de limitations. En effet, Apple reconnait que son outil rencontre encore certaines difficultés dans certains scénarios : malgré ses progrès en matière d’édition image avec un score global impressionnant de 4,31 sur ImgEdit — surpassant ainsi OminiGen2 tout en rivalisant avec GPT-Image-1 — il éprouve parfois du mal à maintenir une cohérence dans l’identité des sujets ou restitué correctement le texte présent dans les images.
Ces faiblesses sont attribuées au détokenizer discret léger utilisé par le modèle qui présente encore quelques lacunes lorsqu’il s’agit maîtriser avec précision certains détails structurels nécessaires à la génération textuelle complète ; signalant ainsi qu’il existe encore plusieurs voies possibles pour améliorer cette technologie dans le futur
Mieux vaut tard que jamais, espérons seulement qu’ils prennent en compte nos retours et améliorent tout ça rapidement! ✨
Cela fait longtemps que je n’ai pas vu un lancement aussi mitigé… Bravo Apple pour la demi-mesure! 🙃
L’avenir semble prometteur avec UniGen-1.5 si ils arrive à régler ces soucis techniques ! Hâte d’avoir ce bijou entre les mains 🚀!
Sérieux, t’es pas fatigué de défendre une technologie qui ne fait que décevoir ? Réveille-toi ! 😤
Ils disent que c’est mieux alors que c’est juste un ajout cosmétique à leur IA déjà moyenne… #déception
Super article, bravo aux chercheurs ! Chapeau bas pour cette avancée technologique qui va tout changer dans le domaine de l’édition visuelle 👏!
Franchement, je suis pas convaincu par cette IA. Encore une promesse sans résultats 🤷♂️
J’adore ce nouveau modèle d’Apple, il est vraiment impressionant ! Je l’ai testé et ça marche du tonnerre ! 😍🎉
LOL, vous croyez vraiment qu’Apple va révolutionner le monde avec ça? C’est juste un coup marketing à mon avis 😂
C’est quoi ces histoires d’alignment ? On dirait qu’ils cherchent encore leurs petits… 🙄
Il était temps qu’ils se bougent pour améliorer leur tech. J’ai hâte de voir des résultats concrets avec UniGen-1.5 ! 💪
On est en 2023 et ils galèrent encore avec les textes sur les images ? On dirait une blague 🙈
Pfff… toujours les mêmes problèmes de cohérence… Ils feraient bien de mieux peaufiner leur truc avant de le balancer au grand public