Le WordPress d'aujourd'hui, décodé pour les développeurs

SEO & GEO

Antipatterns de flux RSS complet : la curation qui vole votre contenu

Ce qu'on observe sur un site de presse locale diffusant un flux RSS intégral, pourquoi le contenu dupliqué se retourne contre l'auteur original, et quoi faire.

Par Clément Hadrot • 21 novembre 2024 • 5 min de lecture • Aucun commentaire
Antipatterns de flux RSS complet : la curation qui vole votre contenu

Un flux RSS qui diffuse l’intégralité d’un article, mise en forme comprise, paraît anodin : c’est même souvent perçu comme un service rendu aux lecteurs équipés d’un agrégateur. Sur un site de presse locale suivi ici, ce choix de configuration par défaut, jamais reconsidéré depuis la création du site, s’est pourtant révélé être une source discrète de contenu dupliqué, avec des conséquences directes sur le référencement des articles originaux.

Ce qu’on observe : des sites tiers qui republient l’article avant même son indexation

Le mécanisme observé est simple à décrire. Des sites de curation, souvent automatisés, s’abonnent à des flux RSS pour republier leur contenu, parfois avec un minimum de réécriture, parfois tel quel. Quand le flux d’origine diffuse l’article dans son intégralité plutôt qu’un simple résumé, ces sites tiers disposent de tout le matériau nécessaire pour publier une copie complète, sans effort supplémentaire de leur part.

Le problème technique survient lorsque ce site tiers, mieux exploré ou disposant d’une autorité de domaine différente, se retrouve indexé avant l’article original, ou que Google, face à deux versions quasi identiques d’un même texte, choisit d’afficher dans ses résultats la version qui n’est pas celle de l’auteur initial. Ce phénomène, bien documenté dans les cas de contenu dupliqué à grande échelle, touche aussi des sites de taille modeste comme une rédaction locale, où chaque article compte davantage puisque le volume de publication est plus faible.

Pourquoi c’est un problème réel, pas une simple question de principe

L'essentiel à retenir : Un flux RSS complet facilite la reprise automatisée du contenu ; Le contenu dupliqué peut se retourner contre la source d'origine ; Passer à un extrait résout le problème sans supprimer le flux

Au-delà de la question de propriété intellectuelle, qui reste un sujet distinct de celui traité ici, l’enjeu de référencement est direct : quand deux versions d’un même contenu coexistent sur le web sans balisage canonical reliant l’une à l’autre, ce qui est presque toujours le cas côté site de curation qui n’a évidemment aucun intérêt à pointer vers l’original, Google doit choisir laquelle afficher. Cette décision échappe entièrement à l’éditeur d’origine, et rien ne garantit qu’elle penche en sa faveur.

Le second effet, plus insidieux, concerne le temps d’indexation. Un article publié à midi et immédiatement récupéré par un agrégateur automatisé peut, selon la rapidité d’exploration respective des deux sites, être exploré et indexé chez le tiers avant même que Googlebot ne visite l’original, une situation qui inverse purement et simplement la perception de l’antériorité.

Pourquoi ce n’est pas une fatalité liée au format RSS lui-même

Le flux RSS en tant que standard n’est pas en cause : c’est la décision de configuration, diffuser le contenu intégral plutôt qu’un extrait, qui ouvre la porte à la reprise automatisée. Un flux limité à un résumé conserve tout l’intérêt du format pour les lecteurs légitimes utilisant un agrégateur, tout en rendant la republication complète beaucoup moins triviale pour un site de curation peu scrupuleux, qui devrait alors visiter l’article original pour en récupérer le texte complet, une étape supplémentaire qui décourage une partie de ces pratiques automatisées.

Quoi faire : passer à un flux en extrait

Le correctif technique reste simple à mettre en œuvre sur WordPress. Le réglage se trouve dans les options de lecture de l’administration, où une case permet de choisir entre l’affichage du texte complet ou d’un résumé dans les flux. Ce réglage peut également être forcé par filtre pour un contrôle plus fin :

add_filter( 'excerpt_length', function ( $length ) {
    return is_feed() ? 40 : $length;
} );
add_filter( 'the_content_feed', function ( $content ) {
    return wp_trim_words( $content, 40 ) . '<p><a href="' . get_permalink() . '">Lire l\'article complet</a></p>';
} );

Sur le site de presse locale concerné, ce changement a réduit le flux d’un contenu intégral à un extrait d’environ 300 caractères suivi d’un lien explicite vers l’article complet, sans modifier en rien l’expérience des lecteurs légitimes utilisant un agrégateur pour suivre l’actualité.

Ce que ce correctif ne règle pas entièrement

Passer à un flux en extrait réduit la facilité de reprise automatisée mais ne l’empêche pas totalement : un site de curation déterminé peut toujours visiter la page originale pour en extraire le contenu. La mesure la plus efficace face à une reprise déjà constatée reste une demande de retrait ou l’ajout d’un lien vers l’original de la part du site fautif, une démarche qui sort du champ purement technique traité ici.

En résumé

Un flux RSS diffusant l’intégralité d’un article, choix de configuration souvent hérité sans réflexion depuis la création d’un site, facilite une reprise automatisée qui peut se retourner contre l’auteur original en matière d’indexation. Passer à un extrait limité, avec lien explicite vers l’article complet, réduit ce risque sans sacrifier l’utilité du flux pour les lecteurs qui l’utilisent légitimement.

Partager :

À propos de l'auteur

Clément Hadrot

Développeur WordPress, passionné par Elementor, le FSE et l’automatisation par IA.

Voir tous ses articles

Dans la même veine

À lire aussi