À retenir : – FastVLM est un modèle de langage visuel d’Apple pour le traitement d’images. – Le modèle peut être testé directement via le navigateur et Hugging Face. – Il offre une rapidité impressionnante grâce au framework MLX. – FastVLM fonctionne localement sans transfert de données, garantissant la confidentialité. – Des versions plus puissantes du modèle sont disponibles, mais ne fonctionnent pas dans un navigateur.
Vous pouvez désormais essayer FastVLM, l’intelligence artificielle ultra-rapide d’Apple dédiée aux sous-titres, directement depuis votre navigateur. Présenté il y a quelques mois, FastVLM est un modèle de langage visuel qui se distingue par sa capacité à traiter des images haute résolution en quasi temps réel. Vous avez la possibilité de le tester sur la plateforme Hugging Face.
FastVLM tire son efficacité d’une technologie avancée : MLX. Il s’agit du framework open source d’apprentissage automatique développé par Apple, spécialement conçu pour ses puces Apple Silicon. Grâce à cela, ce modèle peut générer des légendes vidéo jusqu’à 85 fois plus vite tout en étant trois fois plus compact que les alternatives présentes sur le marché. Une version allégée, nommée FastVLM-0.5B, est accessible dans votre navigateur via Hugging Face.
Une fois activé, FastVLM décrit les scènes vidéo avec une grande précision en temps réel. L’interface utilisateur propose diverses suggestions de prompts pour interagir avec le modèle, telles que « Décrire ce que tu vois en une phrase », « Quelle est la couleur de mon t-shirt ? » ou encore « Identifier les émotions ou actions représentées ». Vous avez également la possibilité d’ajuster ces prompts selon vos préférences ou même d’utiliser une caméra virtuelle pour fournir des vidéos au modèle et observer ses analyses détaillées. Cette capacité à traiter rapidement plusieurs scènes démontre clairement la puissance et la précision de FastVLM ; bien qu’il soit parfois difficile de saisir l’information dans son ensemble lorsque celle-ci est abondante.
Un autre aspect intéressant de FastVLM est sa capacité à fonctionner localement directement dans le navigateur sans nécessiter de transfert vers des serveurs externes. Ce traitement local assure également un fonctionnement hors ligne, ce qui ouvre la voie à des applications potentielles sur des dispositifs comme des lunettes intelligentes ou des montres connectées où l’aspect léger et faible latence sont essentiels. Cette approche permet aussi de garantir une meilleure confidentialité pour les utilisateurs préoccupés par leurs données personnelles.
Actuellement, la démo utilise un modèle comprenant 500 millions de paramètres, mais la famille FastVLM comprend également des versions plus puissantes atteignant jusqu’à 1,5 milliard et 7 milliards de paramètres offrant ainsi encore plus de performance. Néanmoins, ces modèles plus complexes ne peuvent pas être exécutés directement dans un navigateur.
Pour explorer davantage le projet FastVLM, rendez-vous sur les plateformes Hugging Face ou GitHub.
If you think @Apple is not doing much in AI, you're getting blindsided by the chatbot hype and not paying enough attention!
They just released FastVLM and MobileCLIP2 on @huggingface. The models are up to 85x faster and 3.4x smaller than previous work, enabling real-time vision… pic.twitter.com/jYCPukNuiK
Rédacteur en chef de Kame House, Nicolas est un passionné des nouvelles technologies et des jeux vidéos depuis toujours. Roule fièrement en Tesla Model 3 depuis 2022 !
! Trop cool! Maintenant je vais arrêter de me prendre la tête avec mes montages vidéo!
Mdr* J’imagine déjà ceux qui se prennent pour des pros grâce à une phrase que l’IA leur suggère. Ridicule !
@Apple: pourquoi faire simple quand on peut faire compliqué ? Un bon vieux sous-titre manuel ça vous dit ?
J’ai testé FastVLM, c’est vraiment rapide, par contre ça bug un peu avec certains clips
$Ça m’énerve$, franchement pourquoi Apple s’entête à ne pas rendre tout cela accessible hors ligne ?
Allez Apple**, fais-le mieux si tu veux que le public t’aime encore !
> Ces nouvelles technologies nous éloignent du réel! Arrêtons avec l’IA avant qu’elle prenne nos jobs!
C’est de la foutaise cette IA, ça sert à rien si on peut pas l’utiliser sans Internet !
Rire* Qui a besoin d’une IA pour décrire des scènes vidéo ? On n’a plus besoin de nos yeux alors ?!
% Incapable % Je savais même pas qu’un outils pareil pouvait exister avant aujourd’hui – quel dommage
= Parfait = Pour moi qui ai souvent besoin de sous-titres rapides et efficaces, c’est exactement ce qu’il me faut!
[En vrai] j’attends le jour où ces machines vont nous comprendre vraiment… Mais là, c’est juste un gadget
Étonnant* La rapidité est impressionnante mais il faut encore bosser sur la précision
#Franchement j’me suis bien marré en testant cette IA, elle a du potentiel malgré ses petits défauts !
C’est une super évolution ! J’adore les nouvelles technologies d’Apple et FastVLM ne fait pas exception. Bravo !
Franchement, ce modèle de langage visuel est incroyable ! Ça va changer ma manière de travailler sur mes vidéos