Une médiathèque WordPress qui a vécu plusieurs années accumule presque toujours un nombre important d’images sans attribut alternatif renseigné, ce texte étant facultatif dans l’interface d’ajout de média et souvent oublié par les rédacteurs pressés. Sur les audits d’accessibilité que nous menons, cette proportion atteint fréquemment une image sur cinq, parfois davantage sur les sites les plus anciens. Face à ce chantier de rattrapage, la génération automatique de textes alternatifs par IA de vision se présente comme une solution rapide. Elle l’est, à condition de comprendre ses limites.
Cet article explique ce que ces outils font bien, où ils échouent systématiquement, et comment les intégrer dans une démarche d’accessibilité sérieuse plutôt que comme un simple cocher de case.
Ce qu’une IA de vision décrit correctement
Les modèles multimodaux capables d’analyser une image identifient sans difficulté les éléments visuels objectifs : un chat orange couché sur un canapé, un graphique en barres avec trois séries de couleurs différentes, une capture d’écran d’un tableau de bord WordPress. Pour ce type d’images descriptives, où le contenu visuel parle de lui-même, la génération automatique produit un attribut alt correct dans la grande majorité des cas, largement suffisant pour répondre à l’exigence de base des critères WCAG sur le contenu non textuel.
Sur une médiathèque volumineuse, obtenir un texte alternatif générique mais correct sur des centaines d’images en quelques minutes reste une amélioration nette par rapport à l’absence totale d’attribut, qui laisse un lecteur d’écran annoncer simplement le nom de fichier de l’image, souvent illisible pour un humain.
Ce que l’IA ne peut pas deviner
Le texte alternatif idéal ne décrit pas seulement ce qui est visible sur l’image, il décrit sa fonction dans le contexte de la page. Une photo de personne souriante utilisée en illustration décorative d’un article de blog n’a pas besoin de description détaillée : un alt vide (alt="") suffit et évite de polluer inutilement la lecture au lecteur d’écran. La même photo utilisée comme portrait d’un intervenant dans une page « À propos » mérite en revanche un texte identifiant la personne. Une IA de vision, qui n’a accès qu’au fichier image isolé, ne peut pas connaître cette intention éditoriale sans contexte supplémentaire.

Le même problème se pose pour les images contenant du texte important, comme les infographies ou les captures de code : une IA de vision peut manquer une partie du texte inclus dans l’image, ou en donner une transcription approximative, alors que ce texte est précisément l’information que l’utilisateur malvoyant a besoin de recevoir intégralement.
Une intégration raisonnable dans WordPress
Le point d’ancrage technique le plus naturel est le hook add_attachment, déclenché à chaque ajout d’un nouveau média dans la bibliothèque, complété par une commande WP-CLI pour traiter le passif existant :
wp mon-extension generer-alt --missing-only --batch-size=25
L’option --missing-only est essentielle : elle évite d’écraser des textes alternatifs déjà renseignés manuellement, potentiellement plus précis que ce que l’IA pourrait produire. Traiter uniquement les images qui n’ont jamais reçu d’attribut garantit que la génération automatique comble un manque plutôt qu’elle ne dégrade un contenu existant.
Une checklist pour un usage responsable
- Ne jamais écraser un texte alternatif déjà présent sans validation explicite
- Prévoir une relecture humaine rapide, au moins par sondage, sur les textes générés en masse
- Laisser un champ vide pour les images purement décoratives, plutôt que de forcer une description générée
- Vérifier systématiquement le texte des images informatives (infographies, captures d’écran de code)
Un texte alternatif généré vaut mieux qu’une absence, mais moins bien qu’une description pensée pour son contexte.
Notre verdict
La génération automatique de textes alternatifs par IA rend un vrai service pour combler le passif d’une médiathèque WordPress négligée, avec un rapport effort-bénéfice difficile à égaler manuellement sur plusieurs centaines d’images. Elle ne dispense toutefois pas d’une réflexion éditoriale sur les images à forte valeur informative, ni d’un contrôle humain minimal, sous peine de remplacer une accessibilité absente par une accessibilité approximative qui donne l’illusion d’être réglée.