Esta traducción aún no ha sido revisada editorialmente. La versión alemana es la vinculante. Deutsche Fassung →
Indexierung
¿Para qué se necesitan mutuamente robots.txt y Sitemap?
robots.txt es el primer archivo que un motor de búsqueda lee en su sitio web; y la referencia al mapa del sitio debe estar allí, la tabla de contenidos legible por máquinas de todas las páginas. El área de comprobación «Indexación» verifica toda la cadena: ¿existe robots.txt, se refiere a un mapa del sitio, es accesible ese mapa del sitio y apunta al dominio correcto?
robots.txt como reglas de la casa de su sitio web
robots.txt es un archivo de texto simple que se encuentra en una dirección fija: su-dominio.at/robots.txt. Los motores de búsqueda lo leen antes de cada visita. Contiene qué áreas del sitio web se permite que los rastreadores visiten; y en el mejor de los casos, una línea que apunta al mapa del sitio. La comprobación recupera el archivo y verifica simultáneamente si una de las reglas de bloqueo afecta accidentalmente la página verificada misma. Un bloqueo en este lugar significaría que los motores de búsqueda no pueden visitar la página en absoluto; una exclusión silenciosa que nadie nota en la práctica diaria.
El mapa del sitio como tabla de contenidos
El mapa del sitio es una lista legible por máquinas de todas las páginas de su sitio web. Los motores de búsqueda lo utilizan para encontrar rápidamente páginas nuevas y modificadas; páginas que están débilmente vinculadas internamente serían difíciles de descubrir sin él. La comprobación sigue la referencia de robots.txt y verifica si el mapa del sitio es realmente accesible. Un error común y silencioso se verifica específicamente: después de un relanzamiento o cambio de dominio, la línea del mapa del sitio a veces aún apunta al dominio antiguo o a uno mal escrito. La referencia luego lleva a ningún lado sin que nadie lo note; el hallazgo señala exactamente esto.
Muestreo en el mapa del sitio
Además, la comprobación toma una muestra de las direcciones listadas en el mapa del sitio e las llama individualmente. Se distinguen tres resultados: direcciones que responden directamente con estado 200 — el estado ideal. Direcciones que llegan solo a través de un redireccionamiento; funcionan pero desperdician esfuerzo de rastreo, ya que el mapa del sitio debe indicar la dirección final. Y direcciones que terminan en error; no deberían estar en el mapa del sitio en absoluto y aparecen en el informe de comprobación junto con el código de estado. Por lo tanto, la tabla de contenidos sigue siendo una fuente confiable en lugar de una colección de enlaces rotos.
- Abra su-dominio.es/robots.txt en el navegador: el archivo debe aparecer y contener una línea "Sitemap:".
- Abra la dirección del Sitemap indicada allí: debe cargarse y enumerar sus páginas actuales.
- Después de cada relanzamiento o cambio de dominio, verifique que la línea del Sitemap siga apuntando al dominio correcto.
- Mantenga el Sitemap de forma automática para que nuevas páginas se añadan y las eliminadas desaparezcan.
- Compruebe que ninguna regla de bloqueo en robots.txt esté impidiendo accidentalmente el acceso a páginas importantes.