# Le budget de crawl expliqué depuis les logs d’un hébergement mutualisé

> Comprendre le budget de crawl à partir d'un cas concret, avec les seuls fichiers de logs bruts disponibles chez un hébergeur mutualisé.

- Auteur : Clément Hadrot
- Publié le : 2020-11-13
- Mis à jour le : 2020-11-13
- Catégorie : SEO &amp; GEO
- URL : https://wpmoderne.dev.wordpress-developpement.fr/seo/budget-de-crawl-logs-hebergement-mutualise/

## L’essentiel

- Le budget de crawl se lit directement dans les logs bruts du serveur
- Un mutualisé limite la fréquence d'exploration, pas seulement le volume
- Googlebot revient plus souvent sur les pages qui changent réellement

D'après la documentation officielle de Google sur le budget d'exploration, celui-ci se définit comme « le nombre d'URL que Googlebot peut et veut explorer ». Cette définition reste abstraite tant qu'on ne l'a pas confrontée à des données réelles. Sur un hébergement mutualisé qui ne propose ni tableau de bord d'analyse de logs ni export simplifié, il faut aller chercher l'information directement dans les fichiers de logs bruts, généralement accessibles en téléchargement compressé depuis le panneau d'hébergement.

Ce cas concret porte sur un site vitrine d'une centaine de pages, hébergé sur un mutualisé d'entrée de gamme, dont les logs des sept derniers jours ont été extraits et filtrés pour ne conserver que les requêtes provenant de Googlebot.

## Isoler les requêtes de Googlebot dans un fichier brut

Le format des logs varie selon l'hébergeur, mais suit généralement le format combiné d'Apache. Une commande simple permet d'isoler les lignes concernant Googlebot, en vérifiant l'agent utilisateur déclaré :

```
grep "Googlebot" access.log | grep -v "bingbot\|SemrushBot" | wc -l
```

Sur ce site, cette commande remonte 340 lignes sur sept jours, soit une moyenne de 48 requêtes de Googlebot par jour. Ce chiffre seul ne dit encore rien : il faut le croiser avec la nature des URL explorées et le code de réponse HTTP associé à chacune.

## Ce que révèle la répartition des URL explorées

En classant les 340 lignes par type de page, une répartition inattendue apparaît : plus de la moitié des visites concernent des URL de pagination de la page d'archive du blog, alors que ces pages changent rarement et n'ont qu'un intérêt limité pour l'indexation. Les fiches produits mises à jour la veille, elles, n'ont été explorées qu'une seule fois sur la période.

> L'essentiel à retenir : Le budget de crawl se lit directement dans les logs bruts du serveur ; Un mutualisé limite la fréquence d'exploration, pas seulement le volume ; Googlebot revient plus souvent sur les pages qui changent réellement

## La notion de budget de crawl, concrètement

Le budget de crawl combine en réalité deux notions distinctes selon la documentation de Google : la capacité d'exploration, limitée par la vitesse de réponse du serveur pour ne pas le surcharger, et la demande d'exploration, qui dépend de la popularité et de la fraîcheur perçue des pages. Sur un mutualisé, la capacité d'exploration constitue souvent le facteur limitant principal : un serveur qui répond lentement ou renvoie des erreurs pousse Googlebot à ralentir spontanément son rythme de visite pour ne pas aggraver la situation.

Les temps de réponse moyens relevés dans les mêmes logs, pour les requêtes de Googlebot uniquement, tournent autour de 900 millisecondes, contre 300 millisecondes pour les visiteurs humains sur les mêmes pages aux mêmes heures. Cet écart suggère que Googlebot subit davantage la contention des ressources partagées du mutualisé aux heures de forte charge.

## Corriger la répartition observée

Deux actions concrètes découlent de cette analyse, sans nécessiter d'outil payant :

- Ajouter une règle dans le `robots.txt` pour limiter l'exploration des paramètres de tri et de pagination profonde qui ne mènent à aucun contenu réellement nouveau.
- Renforcer le maillage interne vers les fiches produits récemment mises à jour, depuis la page d'accueil et les pages de catégorie, pour signaler leur fraîcheur à Googlebot sans attendre son prochain passage naturel.

### Refaire le point un mois plus tard

Un nouvel export de logs, un mois après ces ajustements, permet de vérifier si la répartition des visites de Googlebot a évolué dans le sens souhaité, avec une part plus importante consacrée aux pages de contenu et une part réduite consacrée aux URL de pagination technique.

> Sur un mutualisé sans outil dédié, un simple `grep` sur les logs bruts en dit souvent plus long que des heures passées sur un rapport agrégé qui ne montre pas le détail des URL réellement explorées.

## En résumé

Le budget de crawl n'a rien d'un concept réservé aux très grands sites : même sur un mutualisé d'entrée de gamme, l'analyse manuelle des logs bruts révèle des déséquilibres concrets entre les pages explorées et celles qui mériteraient de l'être davantage. Cette lecture directe, sans outil payant, reste accessible à quiconque sait extraire et filtrer un fichier `access.log`.
