Crawler: qué significa y cómo rastrea tu web
Un crawler es el programa que recorre la web enlace a enlace para descubrir páginas y llevárselas al buscador. Qué significa el término, cómo funciona el rastreo y cómo se controla.
Tabla de contenidos
Un crawler es un programa que recorre la web de forma automática siguiendo enlaces, descarga las páginas que encuentra y se las lleva al sistema que lo ha enviado. En castellano se le llama rastreador o araña, y de ahí viene también el verbo crawlear: la acción de recorrer un sitio de esa manera.
El más conocido es Googlebot, el rastreador de Google, pero hay muchos más y no todos vienen a lo mismo.
Cómo funciona el rastreo, paso a paso
El proceso es más simple de lo que suele contarse:
- El crawler parte de una lista de URLs conocidas. Salen de rastreos anteriores, de los sitemaps que le has enviado y de enlaces que ha visto en otros sitios.
- Pide cada URL como lo haría un navegador y guarda la respuesta.
- Extrae los enlaces que encuentra en el HTML y los añade a la cola de lo pendiente.
- Repite, priorizando lo que considera más importante o más probable que haya cambiado.
De ahí sale la consecuencia práctica que más importa en SEO: una página a la que no llega ningún enlace es una página que el crawler no descubre. Puede existir, estar bien escrita y cargar rápido, y aun así no entrar nunca en el índice. Es lo que llamamos una página huérfana.
Rastrear no es indexar
Se confunden constantemente y son dos fases distintas. Rastrear es descargar la página. Indexar es analizarla y decidir si merece guardarse para mostrarla en los resultados.
Google puede rastrear una página y decidir no indexarla, y así se lo dirá en Search Console. Y al revés: puede indexar una URL que no ha podido rastrear, si le llegan suficientes señales externas, aunque entonces no tenga contenido que mostrar.
Qué tipos de crawlers pasan por tu web
No todo el tráfico automático es igual, y distinguirlo importa cuando miras los registros del servidor:
- Rastreadores de buscadores. Googlebot, Bingbot, DuckDuckBot. Son los que quieres que entren y lo hagan a menudo.
- Rastreadores de herramientas SEO. AhrefsBot, SemrushBot, MJ12bot. Construyen sus propios índices de enlaces. Son legítimos, pero pueden ser intensos: si consumen demasiados recursos, se les pone un
Crawl-delayo se les limita en el servidor. - Rastreadores de modelos de IA. GPTBot, ClaudeBot, PerplexityBot y compañía, que recogen contenido para entrenar o para responder consultas. Aquí ya es una decisión de negocio: hay quien los bloquea y quien prefiere aparecer en esas respuestas.
- Bots que mienten sobre quién son. Scrapers y rastreadores abusivos que se identifican como Googlebot. Se detectan comprobando que la IP corresponde de verdad a Google con una resolución inversa.
- Tu propio crawler. Screaming Frog y similares, que recorren tu sitio igual que lo haría un buscador para enseñarte lo que encontraría.
Cómo se le dice a un crawler qué puede hacer
Hay tres mecanismos y cada uno hace una cosa distinta. Mezclarlos es el origen de la mitad de los problemas de indexación que vemos.
robots.txt controla el rastreo. Un Disallow le dice al crawler que no pida esa ruta. Ojo con lo que implica: si la página está bloqueada, el rastreador no puede leerla, así que tampoco puede ver un noindex que hubiera dentro. Bloquear para desindexar no funciona; suele conseguir lo contrario.
La etiqueta meta robots controla la indexación. Un noindex le dice al buscador que puede leer la página pero que no la guarde. Para que la lea, la URL no puede estar bloqueada en robots.txt.
El atributo rel="nofollow" era una indicación sobre un enlace concreto. Desde 2019 Google lo trata como una pista, no como una orden, y en enlaces internos no sirve para ahorrar autoridad: eso no funciona desde hace más de quince años.
Una regla que conviene tener grabada: la paginación nunca se bloquea. Suele ser el único camino por el que un buscador descubre el catálogo o el archivo del blog, y cerrarla deja cientos de páginas sin ruta.
El presupuesto de rastreo
Ningún buscador dedica recursos infinitos a un sitio. A la cantidad de páginas que rastrea en un periodo se le llama crawl budget, y depende sobre todo de dos cosas: lo rápido que responda tu servidor y cuánto le interese tu contenido.
En una web de cien páginas es irrelevante. En una tienda con decenas de miles de URLs sí decide qué se indexa y qué no, y ahí lo que lo desperdicia siempre es lo mismo: filtros que generan combinaciones infinitas, parámetros de ordenación, URLs duplicadas por mayúsculas o barras finales, y cadenas de redirecciones. Limpiar eso hace más por la indexación que publicar más contenido.
Cómo ver tu web como la ve un crawler
- Search Console es la fuente buena para lo que hace Google en tu sitio: qué ha rastreado, cuándo, qué ha descartado y por qué. La inspección de URL enseña además el HTML renderizado.
- Screaming Frog recorre tu sitio como lo haría un buscador y te devuelve códigos de respuesta, redirecciones, canonicals, títulos duplicados y páginas huérfanas.
- Los registros del servidor son lo único que dice la verdad completa sobre quién ha entrado y con qué frecuencia. Es donde se ve si Googlebot está gastando el tiempo en las páginas que te interesan o en un calendario de eventos de 2019.
Cruzar las tres fuentes es justo lo que hacemos en una auditoría SEO: cada una sola deja huecos, y los problemas de rastreo suelen aparecer precisamente en lo que una fuente no ve.
Preguntas frecuentes
¿Qué significa crawler en español?
Rastreador, o araña web. Las tres formas se usan indistintamente en el sector, y del término inglés sale también el verbo crawlear para referirse a la acción de recorrer un sitio.
¿Crawlear e indexar son lo mismo?
No. Crawlear es descargar la página; indexar es guardarla para poder mostrarla en los resultados. Una página puede rastrearse y no indexarse, y esa distinción es la que explica la mayoría de los mensajes de Search Console.
¿Cómo sé si Googlebot está rastreando mi web?
En Search Console, en las estadísticas de rastreo, que muestran cuántas peticiones hace al día, cuánto tarda tu servidor en responderle y con qué códigos. Para el detalle completo, los registros del servidor.
¿Puedo obligar a Google a rastrear una página ya?
Puedes pedirlo con la inspección de URL de Search Console, y suele acelerar el proceso de semanas a días. Pedir no es garantizar: si la página no le parece relevante, Google puede rastrearla y no indexarla igualmente.
¿Bloquear un crawler en robots.txt lo saca de Google?
No, y es el error más repetido. Bloquearlo impide que lea la página, así que si dentro hubiera un noindex nunca lo verá. La URL puede seguir apareciendo en los resultados, sin descripción. Para desindexar hay que dejar que entre y ponerle un noindex.
¿Debería bloquear a los rastreadores de IA?
Es una decisión de negocio, no técnica. Bloquearlos protege tu contenido de que alimente a un modelo; dejarlos entrar te da opciones de aparecer citado cuando esas herramientas responden. Lo que sí conviene es decidirlo a propósito, no por descuido.
Comparte este artículo
Si te ha resultado útil, ayuda a otros a encontrarlo.
SEO
Especialista SEO en RoiLab enfocada en optimización on-page y estrategias de contenido. Su atención al detalle y conocimiento profundo de los factores de posicionamiento garantizan que cada página alcance su máximo potencial en los resultados de búsqueda.
Ver perfil completo