Esta tradução ainda não foi revista editorialmente. A versão alemã é vinculativa. Deutsche Fassung →
Indexierung
Para que se precisam robots.txt e mapa do site mutuamente?
O robots.txt é o primeiro arquivo que um motor de busca lê no seu site — e ali deve estar a referência ao sitemap, o índice legível por máquina de todas as páginas. A área de verificação «Indexação» testa toda a cadeia: existe um robots.txt, ele aponta para um sitemap, esse sitemap é acessível, e ele aponta para o domínio correto.
O robots.txt como regras da casa do seu site
O robots.txt é um arquivo de texto simples que reside em um endereço fixo: seu-dominio.at/robots.txt. Os motores de busca o leem antes de cada visita. Ele especifica quais áreas do site os crawlers podem visitar — e idealmente inclui uma linha apontando para o mapa do site. A verificação busca o arquivo e verifica incidentalmente se alguma das regras de bloqueio acidentalmente afeta a página verificada. Um bloqueio neste local significaria que os motores de busca não podem visitar a página — uma exclusão silenciosa que ninguém notaria no dia a dia.
O sitemap como índice de conteúdo
O sitemap é uma lista legível por máquina de todas as páginas do seu site. Os motores de busca o usam para encontrar rapidamente páginas novas e alteradas — especialmente páginas fracamente vinculadas internamente seriam difíceis de descobrir sem ele. A verificação segue a referência do robots.txt e verifica se o sitemap é realmente acessível. Um erro comum e silencioso é especificamente testado: após um relançamento ou mudança de domínio, a linha do sitemap às vezes ainda aponta para o domínio antigo ou incorretamente digitado. A referência então aponta para o vazio, sem que ninguém perceba — a constatação aponta especificamente para isso.
Amostragem dentro do sitemap
Além disso, a verificação tira uma amostra dos endereços listados no sitemap e os busca individualmente. Três resultados são distinguidos: endereços que respondem diretamente com status 200 — o estado desejado. Endereços que chegam via redirecionamento — funcionam, mas desperdiçam esforço de rastreamento, pois o sitemap deve nomear o endereço final. E endereços que terminam em erro — não pertencem ao sitemap e aparecem no relatório de verificação com o código de status. Assim, o índice permanece uma fonte confiável em vez de uma coleção de links mortos.
- Acesse seu-dominio.at/robots.txt no navegador — o arquivo deve aparecer e conter uma linha «Sitemap:».
- Abra o endereço do sitemap mencionado — deve ser carregável e listar suas páginas atuais.
- Após cada relançamento ou mudança de domínio, verifique se a linha do sitemap ainda aponta para o domínio correto.
- Deixe que o mapa do site seja mantido automaticamente para que novas páginas entrem e as eliminadas desapareçam.
- Verifique que nenhuma regra de bloqueio no robots.txt bloqueia acidentalmente páginas importantes.