# Contenu dupliqué entre langues : ce que révèlent vraiment les rapports Search Console

> Un site multilingue voit une partie de ses pages traduites classées « dupliquées » par Google, malgré une traduction réelle et propre. Voici comment lire les bons rapports de couverture pour identifier la cause exacte.

- Auteur : Clément Hadrot
- Publié le : 2023-03-07
- Mis à jour le : 2023-03-07
- Catégorie : Multilingue
- URL : https://wpmoderne.dev.wordpress-developpement.fr/multilingue/contenu-duplique-langues-search-console/

## L’essentiel

- Le rapport « Page en double sans URL canonique sélectionnée » n'est pas toujours lié à la traduction elle-même
- Comparer le contenu réellement exploré par Googlebot évite les fausses pistes
- Un contenu trop proche d'une langue à l'autre peut suffire à déclencher ce classement

Un client éditeur d'un comparateur d'assurances, disponible en français et en anglais pour sa clientèle expatriée, nous a transmis une capture d'écran alarmante de Search Console : trente-quatre pages de la version anglaise apparaissaient dans le rapport de couverture sous le statut « Page en double sans URL canonique sélectionnée par l'utilisateur ». Le contenu de ces pages avait pourtant bien été traduit intégralement par un traducteur professionnel, sans copier-coller depuis la version française. Le client soupçonnait un problème de configuration hreflang, déjà écarté par un premier diagnostic technique.

Nous avons repris le sujet depuis le rapport Search Console lui-même, sans présupposer la cause, pour comprendre ce que ce statut précis signifie réellement et ce qu'il ne signifie pas.

## Ce que signifie ce statut précis dans le rapport de couverture

Le statut « Page en double sans URL canonique sélectionnée par l'utilisateur » indique que Google a détecté, parmi les URL qu'il connaît, un groupe de pages dont le contenu lui paraît suffisamment proche pour être traité comme un ensemble de doublons, et qu'aucune balise canonique explicite ne lui indique laquelle privilégier dans l'index. Ce n'est **pas nécessairement lié à une mauvaise configuration hreflang** : hreflang indique une relation de traduction entre versions linguistiques, mais n'empêche pas Google de juger, indépendamment, que deux pages sont trop similaires pour être indexées séparément.

## Première étape du diagnostic : isoler le vrai contenu vu par Googlebot

> L'essentiel à retenir : Le rapport « Page en double sans URL canonique sélectionnée » n'est pas toujours lié à la traduction elle-même ; Comparer le contenu réellement exploré par Googlebot évite les fausses pistes ; Un contenu trop proche d'une langue à l'autre peut suffire à déclencher ce classement

Nous avons utilisé l'outil d'inspection d'URL de Search Console sur trois pages concernées, en cliquant sur « Afficher la page explorée » pour comparer le rendu réellement capturé par Googlebot au contenu attendu. Sur ce site, deux causes distinctes sont apparues :

- Sur une partie des pages, un module de contenu latéral (encart de blog récent, liste de garanties standards) restait affiché dans sa version française sur la page anglaise, faute d'avoir été traduit dans le composant concerné — un oubli localisé, invisible à l'œil sur la page principale mais représentant, en proportion du texte total de certaines fiches courtes, une part significative du contenu indexable.
- Sur une autre partie des pages, plus préoccupante, le contenu traduit était fidèle sur le fond mais structurellement quasi identique phrase par phrase à l'original, avec une structure de paragraphes calquée au mot près sur la version française, y compris dans l'ordre des arguments — un style de traduction très littéral qui, cumulé à des données structurées et des balises de titre proches, a probablement renforcé la perception de similarité par les algorithmes de Google.

## Distinguer une vraie duplication d'une simple proximité structurelle

Un point de méthode important : Google ne compare pas seulement le texte visible, mais un ensemble de signaux incluant la structure HTML, les données structurées, les balises de titre et meta description. Deux pages traduites fidèlement, avec un texte totalement différent lexicalement mais une structure de balisage identique aux mêmes emplacements (même nombre de `<h2>`, mêmes intitulés de tableau traduits terme à terme), peuvent statistiquement ressembler à des doublons aux yeux d'un système conçu pour détecter du contenu recyclé.

## Les correctifs appliqués sur ce projet

1. Traduction du module de contenu latéral resté en français, identifié via l'inspection d'URL comme la cause la plus visible sur une quinzaine de pages.
2. Reformulation de certains paragraphes de la version anglaise pour s'éloigner d'une structure trop calquée sur l'original, sans changer le sens ni le ton du contenu source.
3. Vérification, page par page concernée, que la balise `rel="canonical"` pointait bien vers l'URL elle-même et non, par erreur d'un template partagé, vers la version française.
4. Nouvelle demande d'indexation via l'outil d'inspection d'URL sur l'échantillon corrigé, plutôt que d'attendre un recrawl naturel.

### Un indicateur à surveiller après correctif

Le rapport de couverture ne se met pas à jour instantanément : nous avons suivi l'évolution du nombre de pages en statut « dupliqué » sur une période de quatre semaines après correctif, plutôt que de conclure à un échec dès les premiers jours suivant la demande d'indexation.

> Un statut de doublon dans Search Console n'accuse pas automatiquement la configuration hreflang. Commencez toujours par regarder ce que Googlebot a réellement vu de la page, avant de remettre en cause l'architecture multilingue.

## Ce que cet article ne traite pas

Ce diagnostic porte sur la lecture des rapports de couverture Search Console pour identifier une cause de duplication. Les erreurs de configuration hreflang elles-mêmes, qui constituent une cause distincte et fréquente de problèmes d'indexation multilingue, ont été traitées séparément et ne sont pas reprises ici.

## En résumé

Un statut de contenu dupliqué sur des pages traduites ne signifie pas systématiquement une erreur de configuration multilingue : il peut provenir d'un module de contenu resté non traduit, ou d'une traduction trop littéralement calquée sur la structure de l'original. L'inspection d'URL de Search Console, en montrant ce que Googlebot a réellement exploré, reste le point de départ le plus fiable avant de remettre en cause l'architecture technique du site.
