# robots.txt de PRODUCTION. # # Il autorise le crawl — y compris sur le domaine de préproduction — et c'est VOLONTAIRE : # la préprod est protégée par un `` posé sur # tout hostname différent de labonneconfig.fr (voir layouts/Site.astro). Or un « Disallow: / » # EMPÊCHERAIT Google de lire ce noindex : il ne crawlerait pas la page, ne verrait jamais la # balise, et pourrait indexer l'URL malgré tout. Bloquer le crawl n'est PAS bloquer l'index. # # Ce fichier était un « Disallow: / » de staging : poussé tel quel le jour de la bascule DNS, # il aurait interdit tout le site à Google, sitemap compris. User-agent: * Allow: / # Pages de service et paramètres sans valeur de recherche. # /search N'EST PLUS bloqué (08/08/2026) : Search Console listait 13 pages « indexées malgré le # blocage » — le piège décrit en tête de ce fichier, subi par nous-mêmes. /search porte déjà # noindex,follow : en laissant Google la crawler, il lit la balise et désindexe proprement. # Aucun lien interne ne pointe vers /search, le coût de crawl est négligeable. Disallow: /api/ Disallow: /*?alerte= Disallow: /*?periode= # Navigation a facettes - filtres libres (16/08/2026, sur exports Search Console). # Ces URLs sont TOUTES en noindex,follow : une facette indexable est servie sur son CHEMIN # (/ram/ddr5), jamais en ?cle=valeur - c'est facetSeo/stateNoindex dans src/lib/seo.ts qui le # garantit. Et pourtant la Search Console en comptait 554 049 encore explorees, re-crawlees le # 11/08, pendant que 15 755 fiches declarees au sitemap n'avaient JAMAIS ete crawlees. # Le rel="nofollow" pose sur les pilules le 08/08 ne suffit pas : il ne vaut que pour les liens, # pas pour le stock d'URLs deja connues de Google. Seul robots.txt coupe le crawl. # # ATTENTION - `?tri=` n'est volontairement PAS dans cette liste : contrairement a ?marque= et # ?prix=, il ne met pas la page en noindex, il pose seulement un canonical vers l'URL nue. # Le bloquer empecherait Google de lire ce canonical : ce serait exactement le piege decrit en # tete de ce fichier (bloquer le crawl n'est pas bloquer l'index). Ses liens sont deja nofollow. Disallow: /*?marque= Disallow: /*&marque= Disallow: /*?prix= Disallow: /*&prix= # Les moteurs de réponse : le site est déjà cité par Gemini et ChatGPT, on ne se ferme pas. User-agent: GPTBot Allow: / User-agent: OAI-SearchBot Allow: / User-agent: ClaudeBot Allow: / User-agent: PerplexityBot Allow: / # Robots IA « documentaires » (03/09/2026) : ceux qui vont lire une page à la demande d'un # utilisateur (ChatGPT, Perplexity, Claude, Le Chat de Mistral) ou qui alimentent une réponse # citée. La règle `*` les autorise déjà ; l'Allow explicite documente le choix et les protège # d'un futur Disallow générique posé par mégarde. Google-Extended = usage Gemini (entraînement # et grounding), Amazonbot = Alexa/Rufus. User-agent: ChatGPT-User Allow: / User-agent: Perplexity-User Allow: / User-agent: Claude-SearchBot Allow: / User-agent: Claude-User Allow: / User-agent: Google-Extended Allow: / User-agent: MistralAI-User Allow: / User-agent: Amazonbot Allow: / # llms.txt : https://labonneconfig.fr/llms.txt Sitemap: https://labonneconfig.fr/sitemap.xml Sitemap: https://labonneconfig.fr/sitemap-bons-plans.xml