Montrer une capture d’écran ou une photo à un modèle de langage classique ne sert à rien : il ne connaît que du texte et ignore purement l’image. Un modèle multimodal lève cette limite en acceptant, et parfois en générant lui-même, plusieurs formes de contenu à la fois : décrire une image, répondre à une question portant sur un graphique, ou produire un visuel à partir d’une simple description textuelle.
Usages concrets pour WordPress
Un modèle multimodal permet, par exemple, d’analyser une image de mise en page envoyée par un client pour en déduire une structure de blocs à recréer dans l’éditeur, de générer automatiquement un texte alternatif (attribut alt) pertinent pour une image de la médiathèque, ou de vérifier visuellement le rendu d’une page avant publication. Certaines extensions de génération d’images pour WordPress s’appuient sur la partie « génération d’image » de ces modèles pour produire des visuels d’illustration directement depuis l’éditeur.
Exemple
Invite (avec image jointe d'un produit) :
"Rédige un attribut alt descriptif de moins de 125 caractères
pour cette image, destiné à un site e-commerce"
Résultat : "Chaise en bois clair avec accoudoirs, vue de trois quarts"
Bon à savoir
- Toutes les fonctionnalités « multimodales » ne sont pas symétriques : un modèle qui comprend une image en entrée ne sait pas forcément en générer une en sortie, et inversement.
- Le texte alternatif généré automatiquement reste à relire : un modèle peut décrire fidèlement l’image sans connaître le contexte métier (nom du produit, particularité mise en avant) qui rend une description vraiment utile.
- Le traitement d’une image consomme généralement plus de ressources qu’un texte de longueur comparable, un facteur à prendre en compte pour le coût et la vitesse d’un traitement en masse.