Saltar para o conteúdo
Serviço de auditoria & selo

Beta — estado de rascunho. O regulamento de auditoria e os avisos ainda não foram aprovados juridicamente; de momento não são emitidos selos vinculativos .

Esta tradução ainda não foi revista editorialmente. A versão alemã é vinculativa. Deutsche Fassung →

Indexierung

Quais são as armadilhas na indexação de danos do robots.txt?

O robots.txt diz aos motores de busca quais áreas não devem recuperar. Dois tipos de entradas causam mais danos do que eles evitam. Primeiro, bloqueando para folhas de estilo, scripts e pastas de ativos: O Google renderiza páginas como um navegador, e sem esses arquivos, ele vê um display desintegrado, avalia erroneamente a simpatia com dispositivos móveis e não consegue encontrar conteúdo recarregado. Em segundo lugar, directivas que nenhum rastreador compreende — Noindex, nofollow ou crawl-atraso em robots.txt — que têm sido ineficazes durante anos e fingem uma segurança que não existe. A área de teste de indexação lê robots.txt e relata ambos.

O que é uma armadilha

Armadilhas de renderização incluem fechaduras cujo caminho termina em arquivos de estilo ou scripts, bem como fechaduras de pastas de ativos típicas: wp-conteúdo e wp-inclui em WordPress, ativos, estática, css, js, imagens, mídia, arquivoadmin e tipo3conf em outros sistemas. Um bloqueio na área interna, busca ou carrinho de compras não é uma armadilha e não é mencionado. Noindex, Nofollow e Crawl-delay são consideradas diretivas ineficazes: Google descontinua suporte não oficial para Noindex em robots.txt 2019; Se você quiser manter uma página do índice, você precisa de uma meta tag ou um cabeçalho na própria página. O resultado indica as linhas afetadas. Não altera o valor do ponto porque o conjunto de regras idx-v1 permanece inalterado; aparece no relatório e na lista de tarefas.

Por que as barreiras são principalmente dos tempos antigos

Antes de 2015, era considerado bom estilo para bloquear tudo, exceto o conteúdo para economizar orçamento rastejar. Uma vez que o Google renderiza páginas completamente, o oposto é verdadeiro: tudo o que pertence à apresentação deve ser recuperável. Muitos arquivos robots.txt ainda carregam as entradas antigas porque eles foram copiados de modelos e nunca foram verificados. A correção é a remoção das linhas; quem realmente precisa proteger diretórios individuais faz isso através de direitos de acesso, não através do robots.txt. Para intenções noindex, a instrução pertence à página: como uma meta tag no cabeçalho ou como o cabeçalho de tag do servidor X-Robots.

  • Remova bloqueios em pastas e arquivos que pertencem ao display: CSS, JS, imagens, pastas de ativos.
  • Substituição Você noindex linhas no robots.txt através de um meta tag robôs com noindex nas páginas relevantes.
  • Use a ferramenta de verificação de URL do Google Search Console para verificar se a visualização renderizada está completa.
  • Mantenha o robots.txt curto: referência sitemap, exclusões reais, nada mais.

Deutsche Fassung dieser Seite

  • Selo Digitale Barrierefreiheit
  • Selo Daten & Recht
  • Selo Technische Qualität
  • Selo Digital Excellence
  • Selo Cyberversicherung

Auditado. Por um futuro digital melhor.euid.com →