seojuice

¿Qué es el rastreo (crawling) en SEO? Cómo los bots de búsqueda leen tu sitio

Vadim Kravcenko
Vadim Kravcenko
· Updated · 8 min read

Resumen (TL;DR): Un rastreo SEO es el paso de descubrimiento y descarga. Googlebot encuentra una URL, obtiene su contenido y puede renderizar su JavaScript. El rastreo no garantiza el indexado ni las posiciones en rankings, así que identifica si el fallo ocurrió en el rastreo, el renderizado, el indexado o el ranking antes de cambiar tu sitio.

La mayoría de los problemas de rastreo se diagnostican desde el extremo equivocado. Una página no aparece en el buscador, alguien concluye que Google no la ha rastreado y se edita robots.txt. Sin embargo, Google puede que ya haya obtenido la página y decidido no indexarla, que haya seleccionado otro canónico o que no haya encontrado motivos para posicionarla para la consulta que estás revisando.

Rastrear, renderizar, indexar y posicionar son puertas separadas. Google sitúa oficialmente el renderizado dentro de la fase de rastreo, pero separarlos durante el diagnóstico hace mucho más fácil localizar fallos técnicos.

Puerta Qué hace Google Fallo típico Dónde investigar
Rastreo Descubre y descarga la URL Bloqueo en robots.txt, timeout, fallo de red, servidor 5xx Inspección de URL, Estadísticas de rastreo, logs del servidor
Renderizado Ejecuta JavaScript y construye la página renderizada JS o CSS bloqueado, scripts fallidos, renderizado pesado del lado del cliente Inspección de URL y salida renderizada
Indexado Analiza la página, elige un canónico y puede almacenarlo noindex, duplicación, contenido débil, se seleccionó otro canónico Inspección de URL y estado de indexado
Ranking y publicación Selecciona y ordena las páginas indexadas para una consulta Coincidencia deficiente con la consulta, calidad o relevancia insuficientes Rendimiento en búsqueda y relevancia a nivel de página
Rastreo, indexado y ranking: tres puertas separadas que debe superar una página.

Qué significa realmente rastrear en SEO

Google Search Central lo define de forma directa:

“Rastreo: Google descarga texto, imágenes y vídeos de páginas que encontró en internet con programas automatizados llamados crawlers.”

En términos prácticos, rastrear es descubrimiento más obtención. Google aprende que existe una URL y solicita su contenido para poder procesar la página más adelante.

El programa que realiza este trabajo es Googlebot. Google lo describe como “también conocido como crawler, robot, bot o spider”. Esos nombres se refieren al mismo tipo general de software: un programa automatizado que solicita páginas y sigue enlaces para descubrir más URLs.

Googlebot no inspecciona tu sitio haciendo “clic” visualmente como una persona. Solicita HTML y recursos de soporte. Durante la fase de rastreo, Google también puede renderizar la página usando una versión reciente de Chrome y ejecutar su JavaScript. Esto importa si tu texto significativo, navegación o enlaces internos no existen hasta que se ejecutan los scripts.

Un último detalle fácil de pasar por alto: Googlebot es predominantemente móvil. Google dice: “Para la mayoría de los sitios, Google Search indexa principalmente la versión móvil del contenido. Como tal, la mayoría de las solicitudes de rastreo de Googlebot se harán usando el crawler móvil, y una minoría usando el crawler de escritorio.” Si contenido importante existe en escritorio pero falta en la versión móvil, una prueba exitosa en escritorio puede darte una confianza falsa.

Yo he pasado tiempo arreglando la puerta equivocada. Que una URL no aparezca en el buscador no prueba que el descubrimiento haya fallado, y pedir otro rastreo no repara contenido duplicado o poco útil (un error de categoría sorprendentemente común).

Rastrear, renderizar, indexar y posicionar son trabajos distintos

1. Rastreo: descubrir y descargar

Googlebot primero necesita saber que existe una URL. Una vez descubierta, intenta obtener el HTML “en bruto” de la página y los recursos necesarios. Una restricción de robots.txt, un fallo de DNS o de red, un timeout o un error del servidor pueden detener el proceso aquí.

Una obtención exitosa hace que la URL pase la primera puerta. Nada más.

2. Renderizado: ejecutar la página

Google incluye oficialmente el renderizado dentro del rastreo, pero vale la pena probarlo por separado (no como una cuarta etapa oficial, para ser precisos). Google indica que durante el rastreo renderiza páginas y ejecuta JavaScript con una versión reciente de Chrome, de forma similar a un navegador normal.

Para aplicaciones basadas en JavaScript, Google documenta la secuencia de trabajo como rastreo, renderizado e indexado. Las páginas que responden con éxito pueden entrar en una cola de renderizado, donde Chromium sin interfaz ejecuta su JavaScript. Google Search usa una versión “evergreen” de Chromium, en lugar de una versión de navegador congelada de forma permanente.

Eso crea una división diagnóstica importante. Googlebot puede obtener una página con HTTP 200 mientras sigue sin poder ver su contenido final. Recursos bloqueados, errores de scripts, contenido del lado del cliente con retraso o enlaces que solo aparecen tras la interacción del usuario pueden dejar el resultado renderizado incompleto.

3. Indexado: analizar y almacenar

Google define el indexado como analizar el texto, las imágenes y los vídeos de una página y almacenar información en el índice de Google. Durante este proceso, Google también evalúa duplicados y elige qué URL considera canónica.

Una página rastreada no se indexa automáticamente. Una directiva noindex puede excluirla. Google también puede rechazar indexar material delgado o sustancialmente duplicado, o puede consolidar la página bajo otra URL canónica. Nuestra guía sobre cómo funciona el indexado de Google cubre esta transferencia con más detalle.

4. Ranking y publicación: responder una consulta

Indexado significa “elegible para aparecer”. No significa que se vea en cada búsqueda ni que garantice una posición concreta. Google aún tiene que decidir que la página coincide con una consulta y determinar dónde encaja entre otros resultados elegibles.

  • Una URL puede descubrirse, pero no obtenerse con éxito.
  • Puede obtenerse, pero renderizarse de forma incorrecta.
  • Puede renderizarse, pero excluirse del índice.
  • Puede indexarse, pero fallar al posicionar para la consulta que estás comprobando.

Google ofrece a los propietarios de sitios una comprobación de realidad útil: “Google no garantiza que vaya a rastrear, indexar o publicar tu página, incluso si tu página cumple con las Google Search Essentials.” La accesibilidad técnica es necesaria. No es una promesa de inclusión o visibilidad.

Cómo descubre Google las páginas

Google no empieza con un directorio completo de cada URL en la web. En su documentación se identifican tres rutas principales de descubrimiento:

  1. Revisitar URL conocidas. Google vuelve a páginas que ya ha obtenido previamente.
  2. Seguir enlaces. Google extrae un enlace de una página conocida y descubre su destino.
  3. Leer sitemaps. Google procesa listas de URLs enviadas por los propietarios de los sitios.

Por eso, el enlazado interno es infraestructura, no decoración. Una página sin enlaces internos que apunten a ella es huérfana. Puede existir en el CMS y aparecer en el sitemap XML mientras permanece desconectada de las rutas que normalmente sigue Googlebot.

El estudio de Cyrus Shepard sobre aproximadamente 23 millones de enlaces internos en cerca de 1.800 sitios encontró una relación direccional entre los enlaces internos y los clics de Google: “Las URLs con 0-4 enlaces internos recibieron un promedio de 2 clics desde Google Search, mientras que las URLs con 40-44 enlaces internos recibieron 4 veces esa cantidad”. Fue una correlación, no una prueba de que añadir enlaces de forma mecánica multiplique el tráfico.

El estudio también encontró que el efecto se revirtió después de unos 45 a 50 enlaces internos. Más no siempre es mejor. La conclusión útil es que las páginas importantes necesitan varias rutas de rastreo relevantes, no que cada página deba recibir docenas de enlaces arbitrarios.

Por lo que vemos en los sitios de SEOJuice, las páginas huérfanas y las rutas internas débiles aparecen mucho más a menudo que los problemas reales de “capacidad de rastreo”. La solución suele ser conectar la página desde contenido relevante ya indexado y mantenerla en el sitemap. Una estructura coherente, como content silos for SEO, ofrece a los rastreadores rutas repetibles entre páginas relacionadas.

Antes yo trataba la inclusión en el sitemap como una evidencia más fuerte de lo que realmente es. Demuestra que una URL fue suministrada a Google, no que Google la haya rastreado o indexado (yo estaba sobreinterpretando la señal). Un sitemap ayuda al descubrimiento; no sustituye los enlaces internos ni obliga a un resultado.

Para una única URL nueva o actualizada, la Inspección de URL en Google Search Console también ofrece una acción de Solicitar indexado. Eso añade una solicitud a la cola de procesamiento de Google. Es un empujón, no una orden.

robots.txt versus noindex versus nofollow: qué controla el rastreo, qué controla el indexado y qué controla el crédito de enlaces.

robots.txt, noindex y nofollow hacen cosas distintas

robots.txt controla la obtención

Un archivo robots.txt le indica a los crawlers que cumplen la norma qué rutas de URL pueden acceder. Google afirma que se usa principalmente para evitar que las solicitudes de rastreo sobrecarguen un sitio.

No es una herramienta de eliminación fiable. La documentación de robots.txt de Google indica que “Una página que robots.txt bloquea aún puede indexarse si otros sitios enlazan a ella” y califica explícitamente el archivo como “no un mecanismo para mantener una página web fuera de Google”. Google puede saber que una URL bloqueada existe sin que se le permita obtener el contenido.

Revisa cada regla amplia antes de publicarla. Un Disallow: / de un entorno de producción contiene muy poco texto y puede eliminar el acceso de Googlebot a todo el sitio. El generador de robots.txt puede ayudar a redactar un archivo, pero su salida aún debe probarse contra tus rutas importantes.

noindex controla la elegibilidad para el índice

Usa noindex cuando Google pueda rastrear una página, pero no debería conservarla en los resultados de búsqueda. No deshabilites también esa URL en robots.txt. Google debe obtener la página para leer su directiva noindex.

Aplicar ambas puede producir lo contrario de la certeza que buscabas. La restricción de rastreo impide que Google vea la instrucción de indexado, así que la URL bloqueada puede seguir siendo conocida mediante enlaces externos o internos.

nofollow es una pista a nivel de enlace

El atributo nofollow no es una prohibición de rastreo a nivel de página. Google lo trata como una pista, no como un bloqueo garantizado. No debe usarse para ocultar una URL, proteger contenido privado o asegurar la exclusión del índice.

La navegación facetada es donde estas definiciones limpias se vuelven menos cómodas. No existe un patrón de robots.txt universalmente seguro para cada catálogo. Algunas URLs filtradas satisfacen búsquedas distintas; otras crean combinaciones efectivamente infinitas. Bloquear primero y mapear el valor después es arriesgado (y sí, esta es una de las áreas donde desconfío de los arreglos de una sola línea).

Probablemente no tienes un problema de “crawl budget”

El “crawl budget” es el conjunto de URLs que Google puede y quiere rastrear. Google describe dos componentes: el límite de capacidad de rastreo, que considera conexiones en paralelo, tiempo de respuesta y la salud del servidor; y la demanda de rastreo, que refleja factores como el tamaño del sitio, la frecuencia de actualización, la calidad, la popularidad y la caducidad (staleness).

El término suena lo bastante importante como para que preocupe a cualquier propietario de un sitio web. Los umbrales de Google dicen otra cosa.

“Si tu sitio no tiene una gran cantidad de páginas que cambian rápidamente, o si parece que tus páginas se rastrean el mismo día en que se publican, no necesitas leer esta guía.”

Google dirige su orientación sobre crawl budget principalmente a sitios con más de un millón de páginas únicas que cambian aproximadamente cada semana, o sitios con más de 10.000 páginas únicas que cambian a diario. Para la mayoría de sitios más pequeños, mantener el sitemap y comprobar la cobertura de indexado suele ser suficiente.

Si publicas un número moderado de URLs y Google obtiene las páginas nuevas con rapidez, deja de intentar optimizar el crawl budget. Arregla las rutas de descubrimiento rotas, directivas accidentales, fallos de renderizado, errores de servidor o problemas de calidad del contenido. Para sitios realmente grandes o muy dinámicos, nuestra guía de optimización de crawl budget cubre casos más difíciles.

Cómo ver qué está rastreando Google

Empieza con la Inspección de URL

Para una página que falta, la Inspección de URL en Google Search Console es el punto de partida más rápido. Puede mostrar la última fecha de rastreo, si se permitió rastrear, el estado de indexado y el canónico seleccionado por Google.

Lee esos campos como una secuencia. Si el rastreo fue bloqueado, corrige el acceso. Si Google rastreó la URL pero la excluyó del índice, es poco probable que otra solicitud de rastreo resuelva el problema subyacente.

Usa Crawl Stats para patrones a nivel de sitio

El informe Crawl Stats muestra el historial de rastreo de Google, incluyendo recuentos de solicitudes, tamaño total descargado, tiempo de respuesta promedio, respuestas del servidor, problemas de disponibilidad, tipos de archivo, propósito del rastreo y el tipo de Googlebot.

Google lo llama un informe avanzado y dice que los sitios con menos de 1.000 páginas generalmente no deberían necesitarlo. Es razonable. Aun así, lo reviso después de migraciones o cambios bruscos a nivel de sitio, pero no es un marcador diario útil (más rastreo no significa automáticamente mejor).

Usa los logs del servidor para solicitudes exactas

Los logs de acceso del servidor registran las solicitudes que realmente llegaron a tu infraestructura. Pueden revelar qué URLs consulta Googlebot, con qué frecuencia visita cada sección y si parámetros o URLs “basura” están recibiendo atención mientras páginas valiosas casi no se visitan.

Las cadenas de user-agent de Googlebot contienen Googlebot/2.1, pero el texto del user-agent se puede imitar. Para identificarlo con fiabilidad, verifica las solicitudes sospechosas de Googlebot mediante DNS inverso y directo en lugar de confiar solo en la cadena.

Para la mayoría de sitios, la actividad real de Googlebot debería ser bastante “suave”. Google dice: “Para la mayoría de los sitios, Googlebot no debería acceder a tu sitio más de una vez cada pocos segundos en promedio”.

Cinco fallos de rastreo SEO que vale la pena corregir

1. Páginas huérfanas y casi huérfanas

Una página huérfana no tiene una ruta de enlace interno desde el resto del sitio. Una casi huérfana puede tener un enlace poco evidente desde un archivo o una página de paginación que Google rara vez vuelve a visitar. Añade enlaces contextuales desde páginas relevantes ya indexadas en lugar de depender solo de un sitemap.

Este suele ser el primer problema estructural que reviso. La URL existe, así que el equipo asume que el sitio la expone correctamente. No es lo mismo.

2. JavaScript o CSS bloqueado

Google renderiza páginas con Chromium. Si robots.txt bloquea los recursos necesarios para revelar contenido o navegación, la solicitud de HTML puede salir bien mientras la página renderizada queda incompleta.

Compara la salida renderizada de Google con lo que ven los usuarios, especialmente en aplicaciones renderizadas del lado del cliente cuyo HTML inicial contiene poco contenido sustantivo.

3. Trampas de rastreo infinito

Los filtros, parámetros de ordenación, calendarios, páginas de búsqueda y los ID de sesión pueden generar cantidades enormes de combinaciones de URLs de bajo valor. Esto se convierte en un problema material de rastreo en sitios grandes.

Las soluciones habituales incluyen consolidar duplicados con canónicos, limitar combinaciones de parámetros rastreables y bloquear patrones adecuados. Mapea qué combinaciones merecen indexado antes de restringirlas; una regla general puede eliminar páginas de categorías valiosas junto con la basura.

4. Servidores lentos o poco fiables

Google ajusta la capacidad de rastreo en respuesta a la salud del servidor. Timeouts persistentes, respuestas lentas y errores 5xx pueden hacer que Google reduzca el rastreo. Crawl Stats puede mostrar cambios agregados en el tiempo de respuesta, mientras que los logs identifican las plantillas y URLs que los provocan.

5. Bloqueos de producción accidentales

Revisa reglas de robots.txt de staging desplegadas en producción, directivas noindex a nivel de sitio, recursos bloqueados y configuraciones del CMS pensadas para desanimar a los motores de búsqueda. Son fallos “mundanos” con consecuencias a nivel de sitio.

Durante nuestra migración de seojuice.io a seojuice.com en enero de 2026, tratamos el descubrimiento, la obtención, la selección de canónico y el indexado como verificaciones separadas. Una URL del host antiguo que se rastreaba de nuevo no probaba que el reemplazo en el host nuevo hubiera sido indexado, y un redirect correcto no probaba que Google hubiera cambiado su canónico todavía. Esa separación nos evitó reducir la migración a una engañosa casilla de verificación “Google lo ve”.

Somos un equipo de dos personas, Lida y yo, así que el orden de diagnóstico importa. No podemos pasar días puliendo teorías de crawl budget mientras una página huérfana o un noindex accidental en producción está haciendo el daño real.

Si esos problemas recurrentes son difíciles de monitorear manualmente, SEOJuice tiene un plan gratuito sin necesidad de tarjeta de crédito. Su automatización puede añadir enlaces internos relevantes y su auditoría del sitio marca bloqueos de robots.txt, etiquetas noindex y recursos bloqueados. Puede corregir o sacar a la luz problemas específicos en el sitio; no puede forzar a Google a rastrear más rápido, indexar una página o otorgar rankings.

Preguntas frecuentes

¿Qué es el rastreo en SEO?

El rastreo en SEO es el proceso mediante el cual los bots de los motores de búsqueda descubren y descargan páginas. Googlebot encuentra URLs revisitando páginas conocidas, siguiendo enlaces y leyendo sitemaps. Un rastreo exitoso no garantiza que una página se indexe o se posicione.

¿Cuál es la diferencia entre rastrear e indexar?

Rastrear significa que Google obtiene una página. Indexar significa que Google analiza la página, evalúa su canónico y puede almacenar información sobre ella en el índice de Google. Una página puede rastrearse pero no indexarse debido a noindex, duplicación, calidad del contenido o una selección de canónico.

¿Qué es un crawler, spider o bot web?

Un crawler web es un programa automatizado que visita URLs, descarga contenido y sigue enlaces para encontrar otras páginas. El crawler de Google es Googlebot. Crawler, spider, robot y bot son nombres distintos para el mismo tipo general de software.

¿Cómo encuentra y rastrea Google mi sitio web?

Google revisita URLs que ya conoce, sigue enlaces desde páginas conocidas hacia destinos nuevos y lee sitemaps XML enviados. Los enlaces internos proporcionan rutas directas de descubrimiento, mientras que el sitemap ofrece una lista útil de URLs que Google puede considerar rastreables.

¿robots.txt evita que Google rastree o indexe?

robots.txt restringe el rastreo, no el indexado. Una URL bloqueada puede seguir apareciendo en Google si se descubre a través de enlaces. Para mantener una página rastreable fuera del índice, usa noindex y no impidas simultáneamente que Google obtenga la directiva.

¿Cómo puedo ver qué está rastreando Google?

Usa la Inspección de URL para el estado de una URL, Crawl Stats para patrones de solicitudes y del servidor a nivel de sitio, y los logs de acceso del servidor para las URLs exactas que solicitó Googlebot. Juntos, esos datos distinguen un fallo real de rastreo de un problema posterior de renderizado o indexado.

SEOJuice
Stay visible everywhere
Get discovered across Google and AI platforms with research-based optimizations.
Works with any CMS
Automated Internal Links
On-Page SEO Optimizations
Get Started Free

no credit card required

More articles

No related articles found.