Navigation à facettes : quels filtres indexer en SEO
« J'ai bloqué mes filtres dans le robots.txt il y a deux mois. Pourquoi sont-ils toujours dans l'index de Google ? » La question revient si souvent qu'elle en devient un réflexe, et sa réponse tient à un mécanisme que la plupart des guides passent sous silence : une URL interdite d'exploration ne peut plus faire lire son noindex. La navigation à facettes est l'exemple parfait de ce malentendu. Dans le rapport « Indexation des pages » de la Google Search Console, ses URL ne portent d'ailleurs pas une étiquette unique : elles se rangent selon ce que Googlebot a réellement fait de chacune.
Alors lesquelles de vos facettes méritent vraiment une place dans l'index ? Comment savoir, famille par famille, dans quel verdict Google les a rangées ? Et une fois la correction déployée, comment vérifier qu'elle a pris ?
La réponse à ces trois questions se trouve au même endroit : dans le rapport d'indexation, à condition de le lire famille de facettes par famille de facettes.
Qu'est-ce que la navigation à facettes ?
La navigation à facettes, ou recherche à facettes, est le système de filtres qui permet d'affiner une page de listing selon les attributs des éléments : couleur, taille, prix, marque. Google la définit comme « une fonctionnalité courante des sites web qui permet à leurs visiteurs de changer la façon dont les éléments sont affichés sur une page ».
Concrètement, un internaute arrive sur la catégorie « T-shirts », coche la couleur « rouge » et la taille « M », et l'adresse devient boutique.com/t-shirts?couleur=rouge&taille=m. Chaque sélection, chaque combinaison de sélections, produit une URL distincte que Google peut découvrir et traiter comme une page à part entière. C'est un confort d'achat indéniable, et les CMS e-commerce (WooCommerce, PrestaShop, Magento) l'activent par défaut. Le problème n'est donc pas le CMS : c'est le nombre d'URL que ce confort engendre.
Pourquoi les facettes débordent : la combinatoire
Les facettes débordent parce que leurs combinaisons se multiplient. Chaque filtre supplémentaire multiplie le nombre d'URL possibles, et Google doit toutes les explorer avant de comprendre qu'elles n'apportent rien. La documentation de Google le décrit sans détour : les robots gaspillent leur temps sur des adresses inutiles au lieu de découvrir les pages qui comptent.
« Les robots accèdent généralement à un très grand nombre d'URL de navigation à facettes avant de déterminer que ces URL sont en réalité inutiles », note Google Search Central. Avec une conséquence directe : « si l'exploration est consacrée à des URL inutiles, les robots ont moins de temps à consacrer aux URL nouvelles et utiles. » C'est le lien direct avec le budget de crawl et, plus largement, avec les enjeux de crawl et d'indexation que les facettes viennent siphonner en silence.
Où atterrissent vos facettes : les quatre verdicts problématiques les plus fréquents
Une URL à facettes peut porter n'importe quel statut du rapport d'indexation. Une facette légitime finit en « Envoyée et indexée » ; une facette traitée bascule en « Bloquée par le fichier robots.txt ». Mais sur des facettes laissées sans règle, quatre verdicts problématiques reviennent plus que les autres. Et c'est justement parce qu'elles se dispersent dans tout le spectre qu'il faut lire le verdict réel de chaque famille, au lieu de le deviner.
| Ce qui arrive à la facette | Statut dans la Search Console | Ce que Google a fait |
|---|---|---|
| Explorée, jugée sans valeur ajoutée | Explorée, actuellement non indexée | Explorée et rendue, non retenue |
| Découverte, jamais explorée | Détectée, actuellement non indexée | Connue, mise en file, pas traitée |
| Quasi-doublon sans canonique déclarée | Page en double sans URL canonique | Regroupée, aucune canonique fournie |
| Canonique déclarée mais ignorée | Google a choisi une autre URL canonique | Canonique remplacée par une autre |
Le triage honnête : quelles facettes méritent l'index ?
Toutes les facettes ne se valent pas. Certaines répondent à une vraie demande de recherche et méritent l'index ; d'autres ne sont que du bruit combinatoire. Le tri repose sur un critère unique : des internautes cherchent-ils cette combinaison sur Google ? Si oui, la page a sa place. Sinon, elle dilue le site sans rien lui rapporter.
Une facette mono-critère colle souvent à une requête réelle. « Robe rouge », « robe rouge taille 40 », « baskets Nike pointure 42 » : ces recherches existent, avec du volume, et une page filtrée bien optimisée peut les capter. Les fermer reviendrait à se priver d'une part de longue traîne parfaitement légitime.
À l'inverse, l'empilement de filtres (?couleur=rouge&taille=40&marque=x&tri=prix) ne correspond à aucune recherche humaine. Personne ne saisit quatre critères d'affilée dans Google. Ces combinaisons n'existent que pour fluidifier la navigation et n'ont rien à faire dans l'index.
Pour trancher, appuyez-vous sur des données concrètes plutôt que sur l'intuition : les requêtes déjà remontées par la Search Console, les volumes de recherche de vos filtres, l'intention derrière chaque combinaison. Gardez aussi un œil sur la cannibalisation : une facette indexée qui vise le même mot-clé que sa catégorie mère finit par lui faire concurrence. L'objectif n'est pas d'indexer le plus de facettes possible, mais les bonnes, celles qui atteignent le statut « Envoyée et indexée » parce qu'elles le méritent.
La matrice : à chaque famille de facette, son traitement
À chaque famille de facette correspond un traitement, et à chaque traitement un verdict attendu dans la Search Console. Une facette utile reste indexable ; une facette de tri se bloque au crawl ; une combinaison de bruit se canonicalise vers sa catégorie mère. La matrice ci-dessous relie chaque décision au statut qu'elle doit produire.
| Famille de facette | Demande de recherche | Traitement recommandé | Verdict attendu |
|---|---|---|---|
Mono-facette utile (?couleur=rouge) |
Oui | Laisser indexable, canonique autoréférente | Envoyée et indexée |
Tri et affichage (?tri=prix, ?affichage=grille) |
Non | Interdire au robots.txt | Bloquée par le fichier robots.txt |
| Combinaison de 2 filtres ou plus | Non | Canonique vers la catégorie mère | Google a choisi une autre URL canonique |
| Facette profonde jamais liée en interne | Non | Interdire au robots.txt, retirer les liens | « Détectée, non indexée » qui se vide peu à peu |
| Facette sans résultat (rupture de stock) | Non | Renvoyer un 404, ou noindex si crawlable | Introuvable (404), ou Exclue par noindex |
Le choix de la méthode n'est pas neutre, et Google a une préférence claire.
Le robots.txt d'abord. « Utilisez le fichier robots.txt pour interdire l'exploration des URL de navigation à facettes », recommande la documentation. C'est la méthode la plus efficace pour préserver le budget de crawl, parce qu'elle arrête Googlebot avant même qu'il ne charge la page. Les facettes ainsi traitées rejoignent le statut « Bloquée par le fichier robots.txt ».
La canonique et le nofollow, en second. Google est explicite sur leur portée : « ces méthodes sont globalement moins efficaces sur le long terme que les méthodes évoquées précédemment. » Elles orientent le choix de Google, elles ne le verrouillent pas.
Le noindex, absent de la recommandation. Fait notable : la documentation de Google sur les facettes ne mentionne à aucun moment le noindex. Non qu'il soit interdit, mais parce qu'il répond à un autre besoin et, surtout, parce qu'il se heurte à un piège.
Le piège robots.txt contre noindex. C'est exactement le malentendu du départ. Un Disallow dans le robots.txt empêche Google d'explorer la page. Or, pour lire une balise noindex, Google doit d'abord explorer la page. Bloquer et désindexer en même temps devient donc contradictoire : un noindex posé sur une URL interdite au crawl ne sera jamais lu. Ce sont deux objectifs différents, qui appellent chacun leur méthode. Pour empêcher l'exploration d'URL pas encore indexées, le robots.txt suffit. Pour retirer de l'index une page déjà présente, laissez-la explorable et posez un noindex, le temps que Google repasse la lire.
Diagnostiquer vos facettes par pattern d'URL, à l'échelle
Pour savoir dans quel verdict atterrit chaque famille de facette, il faut le jugement officiel de Google, URL par URL. L'outil d'Inspection d'URL de la Search Console le donne, mais une seule adresse à la fois. Sur un catalogue de plusieurs milliers de facettes, l'auditer ainsi est hors de portée.
IndexProbe est la version en masse de cet outil d'Inspection d'URL. Vous lui confiez la liste des facettes à surveiller, ou vous la constituez directement depuis votre Search Console par pattern d'URL : une expression régulière sur ?couleur=, ?tri= ou n'importe quel paramètre suffit à réunir toute une famille. Pour chaque URL, vous récupérez le verdict d'indexation détaillé, le motif de non-indexation, la canonique retenue par Google, la date du dernier passage de Googlebot et le statut au regard du robots.txt.
Le tout sans analyse de logs ni crawler tiers. IndexProbe n'explore pas votre site en suivant des liens : il interroge l'API officielle de la Search Console sur la liste que vous fournissez ou que vous constituez depuis la GSC (Google Search Console). Là où l'inspecteur impose une URL à la fois, vous obtenez le même verdict officiel, daté, sur toute votre liste, dans un tableau filtrable que vous relancez quand vous le souhaitez. C'est aussi le point de départ du diagnostic des pièges d'indexation propres aux CMS e-commerce.
Vérifier que la correction a pris
Une correction ne se constate pas le jour du déploiement, mais le jour où Google repasse. La vérification se fait dans le temps, en comparant deux analyses de la même liste de facettes, avant et après. Ce qu'on cherche dans cette comparaison, ce n'est pas un chiffre isolé mais un mouvement de statuts, famille par famille.
Après avoir interdit les facettes de tri au robots.txt et canonicalisé les combinaisons vers leur catégorie mère, vous attendez un déplacement précis. Les URL de tri quittent l'index et rejoignent « Bloquée par le fichier robots.txt » ; les combinaisons de bruit basculent en « Google a choisi une autre URL canonique » ; et le crawl, libéré, revient vers vos fiches produit. La vue Comparaison met ce déplacement en évidence, statut par statut, entre deux relances de la même liste.
💡 Pour savoir ce que Google fait réellement de vos facettes, le plus fiable reste de lire son verdict, famille par famille.