← retour Fenêtre de bureau à Londres sous la pluie au crépuscule, carnet avec des notes manuscrites et un thé froid sur un bureau, ambiance cinématographique et éditoriale

Crawled Currently Not Indexed : Comment je le corrige

En 2021, un cabinet d'avocats local à Manchester s'est adressé à Seahawk après que leur blog soit resté inactif dans Search Console pendant quatre mois. Quarante-trois articles. Zéro indexé. Tous affichant « Crawled, currently not indexed ». L'agence précédente avait haussé les épaules et leur avait dit que Google était « juste lent ». J'ai ouvert le site l'après-midi même et trouvé la cause racine en quatre-vingt-dix minutes. Contenu mince, méta-descriptions en doublon sur les pages d'domaines de pratique affectant le budget de crawl du blog, et un sitemap Yoast mal configuré pointant vers des archives de catégories en noindex.

Cette phrase, « Crawled, currently not indexed », est l'un des statuts les plus frustrantes que Google Search Console puisse afficher. Cela signifie que Google a trouvé la page. Il a dépensé des ressources pour la télécharger. Et puis il a regardé ce qui était là et a dit : ça ne vaut pas le coup. Comprendre pourquoi Google prend cette décision, et la corriger systématiquement, c'est quelque chose que je dois maîtriser sur 12 000+ sites.

---

Ce que « Crawled Currently Not Indexed » signifie réellement

Il existe une idée reçue courante selon laquelle ce statut signifie que Google n'a pas encore eu le temps d'indexer. Ce n'est pas ce que cela signifie. Google a exploré l'URL. Il a fait un choix délibéré de ne pas l'inclure dans l'index. C'est un problème entièrement différent, et il nécessite une approche différente.

Les deux grandes causes sont les signaux de qualité et les signaux techniques. Signaux de qualité : Google pense que la page n'ajoute pas assez de valeur pour servir les utilisateurs. Signaux techniques : quelque chose dans votre configuration confond Googlebot ou contredit votre intention. Les deux sont corrigeables. Aucun ne se corrige de lui-même.

Ça vaut le coup de lire la propre documentation de Google sur le fonctionnement de Google Search si vous voulez comprendre le pipeline du crawl à l'indexation. C'est aride mais utile.

---

Étape un : Obtenir l'image complète dans Search Console

Ne devinez pas. Ouvrez Google Search Console et allez dans Pages (anciennement Coverage). Filtrez sur « Crawled, currently not indexed ». Exportez la liste. Vous voulez l'ensemble complet des URL, pas seulement un échantillon.

Je croise ensuite cette liste avec un crawl Screaming Frog du même site. Chaque fois. Screaming Frog vous indiquera le nombre de mots de la page (via l'extraction personnalisée ou les métriques de lisibilité intégrées), si elle est dans le sitemap XML, l'état de sa balise canonique, sa directive meta robots, le nombre de liens internes vers la page et le code de réponse. Cette combinaison vous dit presque tout ce que vous devez savoir.

Ce que je cherche en premier

  • Pages contenant moins de 300 mots de contenu dans le corps
  • Pages ayant des méta-descriptions identiques ou quasi-identiques avec d'autres pages indexées
  • Pages non incluses dans le sitemap XML
  • Pages recevant zéro lien interne
  • URL d'pagination orphelines ou pages d'archives fines étant explorées

Dans le cas des avocats de Manchester, les articles de blog contenaient en moyenne 180 mots. C'était le problème fondamental. Tout le reste était secondaire.

---

Le problème de qualité : Google pense que votre page n'est pas assez bonne

C'est inconfortable à entendre, mais c'est la cause la plus courante que je vois. Le seuil de qualité de Google a considérablement augmenté depuis 2022. Les pages qui auraient tranquillement restées dans l'index il y a trois ans sont maintenant activement exclues.

contenu mince

Si une page contient moins de 400-500 mots et ne présente pas de forts signaux E-E-A-T (biographie de l'auteur, citations, insight original), Google va souvent l'explorer et la mettre de côté. J'ai vu cela particulièrement avec :

  • Les pages de produits WooCommerce avec des textes du fabricant copiés-collés tel quel
  • Les annonces immobilières avec des descriptions de propriétés de deux lignes
  • Les pages de localisation construites à partir d'un modèle avec seulement le nom de la ville changé
  • Les anciennes pages FAQ qui répondent à une question en un paragraphe

La solution n'est pas juste d'ajouter des mots. Ajouter du remplissage aggrave les choses. La solution est d'ajouter des informations utiles et spécifiques qu'un humain aurait réellement envie de lire. Pour les avocats, j'ai réécrit leurs articles de blog pour inclure de vrais résultats de cas (anonymisés), des références spécifiques à la législation britannique, et des exemples pratiques. Le nombre de mots a augmenté de 180 à 900. Huit semaines plus tard, trente et un des quarante-trois articles étaient indexés.

Contenu Dupliqué et Quasi-Dupliqué

Le rapport de contenu dupliqué de Screaming Frog est votre allié ici. Mais aussi passez les URL par Copyscape ou Siteliner si vous êtes préoccupé par la duplication entre sites. J'ai eu des clients dans l'e-commerce où leur fournisseur fournis la même description de produit à quarante autres détaillants. Google indexe une seule et ignore le reste. Ce n'est pas un bug, c'est le fonctionnement prévu.

La quasi-duplication interne est plus sournoise. Si vous avez un site avec des pages de services pour « Plombier à Lyon », « Plombier à Marseille », « Plombier à Toulouse », et qu'elles sont 95% identiques à part le nom de la ville, Google va en choisir une et supprimer le reste. J'ai vu ce schéma faire tomber des systèmes de recherche à facettes entiers dans le statut « Explorée, actuellement non indexée ».

---

Le Problème Technique : Quelque Chose dans Votre Configuration Envoie des Signaux Contradictoires

Parfois le contenu est véritablement bon et Google refuse toujours de l'indexer. C'est là qu'il faut creuser les signaux techniques.

Confusion de Balise Canonique

C'est le coupable technique numéro un que je trouve. Une page se canonicalise elle-même (correct), mais quelque part en amont, une page de catégorie ou une URL paginée a une canonique pointant vers la page que vous voulez indexer. Google interprète parfois cela comme un signal que la source canonique est un doublon. J'ai vu des thèmes WordPress faire cela automatiquement de façons véritablement difficiles à repérer sans un crawl.

Vérifiez : chaque page de votre liste « Explorée, actuellement non indexée » a-t-elle une canonique auto-référencée ? Est-ce que quelque chose d'autre sur le site a une canonique pointant vers ces URL de façon inattendue ?

Problèmes de Plan de Site XML

Votre sitemap ne devrait lister que les URL que vous voulez vraiment indexer. Cela semble évident. En pratique, Yoast, Rank Math, et la plupart des autres plugins SEO vont gaiement inclure les pages noindexées, les URL paginées, et les archives d'étiquettes dans votre sitemap si vous n'êtes pas prudent. Google voit une URL dans votre sitemap, l'explore, trouve un noindex ou du contenu mince, et c'est un crédit de crawl perdu, plus un signal de confiance que vous ne savez vraiment pas ce que vous faites avec votre site.

J'audite les sitemaps avec un processus simple :

  1. Téléchargez le XML du sitemap
  2. Importez chaque URL dans une feuille de calcul
  3. Passez chaque URL par Screaming Frog (ou utilisez l'export en masse)
  4. Signalez chaque URL qui est noindexée, redirige, ou retourne un statut non-200
  5. Supprimez ces URL du sitemap

Cela seul a résolu les statuts « Explorée, actuellement non indexée » pour trois clients l'année dernière. Sans toucher au contenu du tout.

Lacunes dans les liens internes

Le PageRank (oui, toujours pertinent, oui, même en 2024) circule via les liens internes. Une page sans aucun lien interne pointant vers elle est effectivement invisible pour Googlebot en termes d'autorité. Google peut la crawler via le sitemap et décider ensuite qu'elle n'est pas assez importante pour l'indexer parce que rien sur le site ne la pointe.

Les pages orphelines sont courantes. J'utilise le rapport « Orphan URLs » de Screaming Frog (sous Site Structure) pour les identifier. Ajoutez trois à cinq liens internes pertinents vers chaque page qui se trouve dans le bucket « non indexée » et vous verrez souvent du mouvement dans les quatre à six semaines.

---

Budget de crawl : quand c'est vraiment un problème de capacité

Pour les petits sites (moins de 1 000 pages), le budget de crawl n'est presque jamais le vrai problème. Je sais que les gens jettent souvent cette explication à la légère. Mais pour les grands sites e-commerce (nous avions un détaillant de mode chez Seahawk avec 80 000 références), cela compte vraiment.

Si Googlebot passe ses visites à crawler votre navigation à facettes infinie, vos paramètres d'ID de session ou vos pages de résultats de recherche interne, il n'arrive pas aux pages de produits qui comptent vraiment. La documentation Google sur le budget de crawl est l'un des rares conseils SEO officiels que je recommande vraiment de lire du début à la fin.

Correction : bloquez les paramètres d'URL qui génèrent des pages quasi-dupliquées via l'outil Paramètres d'URL (si vous utilisez toujours l'ancienne Search Console) ou via robots.txt pour Googlebot, et assurez-vous que vos pages de recherche interne sont noindexées. Cela libère la capacité de crawl pour les pages qui comptent.

---

Demander l'indexation : quand l'utiliser et quand ne pas l'utiliser

Le bouton « Demander l'indexation » dans Search Console est utile pour les URLs individuelles prioritaires après que vous ayez fait des changements. Ce n'est pas un substitut pour corriger la cause sous-jacente. Je vois des freelancers cliquer compulsivement sur ce bouton pour des pages qu'ils n'ont pas touchées. Cela ne fait rien en soi.

Ma règle : corriger d'abord, demander ensuite. Après avoir fait des changements substantiels au contenu, aux balises canoniques ou aux liens internes, soumettez l'URL via l'outil Inspection d'URL. Attendez deux à quatre semaines. Si elle n'est toujours pas indexée après cela, le problème sous-jacent n'a pas été résolu.

Une dernière chose : le quota de demande d'indexation est limité. Ne le gaspillez pas sur des pages qui ont toujours du contenu mince ou des configurations canoniques cassées. Vous demandez juste à Google de confirmer sa propre décision.

---

Combien de temps faut-il pour résoudre le problème ?

Honnêtement, cela varie plus que la plupart des guides SEO l'admettent. J'ai vu des pages passer de « Crawlée, actuellement non indexée » à indexée en cinq jours après une mise à jour de contenu. J'en ai vu d'autres prendre douze semaines. Les facteurs qui semblent avoir le plus d'importance :

  • Le niveau d'autorité global du domaine (les domaines plus anciens et liés voient une reconsidération plus rapide)
  • Si la correction était liée au contenu (plus lente) ou technique (plus rapide)
  • La fréquence à laquelle Googlebot visite le site (consultez le rapport Statistiques de crawl dans Search Console)

Configurez un tableur de suivi. Notez la date à laquelle vous avez fait les changements. Vérifiez Search Console tous les deux semaines. Ne paniquez pas si rien ne bouge la première semaine.

---

FAQ

Pourquoi Google crawle une page mais ne l'indexe pas ensuite ?

Le crawl et l'indexation sont des étapes séparées dans le pipeline de Google. Le crawl signifie juste que Googlebot a téléchargé la page. L'indexation signifie que Google a décidé qu'elle mérite d'être affichée dans les résultats de recherche. L'écart se produit quand l'évaluation de qualité de Google détermine que la page n'ajoute pas assez de valeur, duplique le contenu existant dans l'index, ou contient des signaux conflictuels comme une balise noindex quelque part dans la chaîne.

Soumettre une URL dans Search Console garantit-il l'indexation ?

Non. Cela met l'URL dans une file d'attente prioritaire pour examen, mais Google prend toujours sa propre décision de qualité. Si la page a du contenu mince ou des problèmes techniques, la soumettre accélère juste Google en confirmant qu'il ne l'indexera pas.

Une page peut-elle être indexée après être restée bloquée dans ce statut pendant longtemps ?

Oui, absolument. J'ai résolu des URLs qui avaient été bloquées en « Crawlée, actuellement non indexée » pendant plus d'un an, une fois que le contenu a été correctement amélioré. Google réévalue. Ce n'est pas une liste noire permanente. Cela dit, si une page est dans ce statut depuis plus de six mois, cela vaut la peine de se demander honnêtement si elle mérite d'être indexée du tout.

Ce statut est-il le même que « Découverte, actuellement non indexée » ?

Non, et la distinction est importante. « Découverte, actuellement non indexée » signifie que Google connaît l'existence de l'URL mais ne l'a pas encore explorée. C'est souvent un problème de budget de crawl ou de lien interne. « Explorée, actuellement non indexée » signifie qu'elle a déjà été évaluée et mise de côté. Les deux nécessitent une attention, mais les solutions sont légèrement différentes.

---

Il n'existe pas de solution miracle pour « Explorée, actuellement non indexée ». D'après mon expérience, c'est presque toujours un problème de qualité de contenu ou un problème de signal technique, généralement une combinaison des deux. Commencez par les données, corrigez ce que vous trouvez, et laissez du temps au processus. Google n'essaie pas de vous punir. Il a juste besoin d'une raison de s'intéresser à la page. Donnez-lui en une.

← retour