Cette traduction n’a pas encore été relue par la rédaction. La version allemande fait foi. Deutsche Fassung →
Indexierung
Quels pièges dans robot.txt mal indexer?
Les robots.txt indiquent aux moteurs de recherche quelles zones ils ne devraient pas récupérer. Deux types d'entrées causent plus de dégâts qu'elles ne l'empêchent. Premièrement, bloquer les feuilles de style, les scripts et les dossiers d'actifs: Google rend des pages comme un navigateur, et sans ces fichiers, il voit un écran désintégré, évalue à tort la convivialité mobile, et ne trouve pas de contenu rechargé. Deuxièmement, les directives que personne ne comprend — Noindex, nofollow ou ramp-delay dans robots.txt — qui sont inefficaces depuis des années et prétendent une sécurité qui n'existe pas. La zone de test d'indexation lit robots.txt et rapporte les deux.
Ce qui est un piège
Les pièges de rendu comprennent les verrous dont le chemin se termine sur des fichiers de style ou des scripts, ainsi que les verrous de dossiers d'actifs typiques: wp-content et wp-includes sur WordPress, actifs, statique, css, js, images, médias, fileadmin et typo3conf sur d'autres systèmes. Un verrou dans la zone interne, la recherche ou le panier n'est pas un piège et n'est pas mentionné. Les directives Noindex, Nofollow et Crawl-delay sont considérées comme inefficaces: Google a cessé de soutenir officiellement Noindex dans robots.txt 2019; Si vous voulez garder une page de l'index, vous avez besoin d'une balise méta ou d'un en-tête sur la page elle-même. Le résultat indique les lignes touchées. Elle ne change pas la valeur de point car l'ensemble des règles idx-v1 reste inchangé; elle apparaît dans le rapport et dans la liste des tâches.
Pourquoi les barrières viennent surtout des temps anciens
Avant 2015, il était considéré comme un bon style pour verrouiller tout sauf le contenu pour économiser le budget de rampe. Puisque Google rend les pages complètement, le contraire est vrai: tout ce qui appartient à la présentation doit être récupérable. De nombreux fichiers robots.txt portent toujours les anciennes entrées parce qu'elles ont été copiées à partir de modèles et n'ont jamais été vérifiées. La correction est la suppression des lignes; qui a vraiment besoin de protéger les répertoires individuels le fait via les droits d'accès, pas via les robots.txt. Pour les intentions de noindex, l'instruction appartient à la page: comme une balise méta dans l'en-tête ou comme l'en-tête de balise du serveur X-Robots.
- Supprimer les verrous sur les dossiers et les fichiers qui appartiennent à l'affichage: CSS, JS, images, dossiers d'actifs.
- Remplacement Vous n'avez pas d'index dans les robots.txt à travers un méta tag robots avec aucunindex sur les pages pertinentes.
- Utilisez l'outil de vérification URL de Google Search Console pour vérifier si la vue rendue est complète.
- Gardez les robots.txt courts: référence du plan du site, exclusions réelles, rien d'autre.




