seojuice

Cómo Google indexa las páginas HTML

Vadim Kravcenko
Vadim Kravcenko
· Updated · 9 min read

TL;DR: Publicar un archivo HTML solo lo deja disponible en tu servidor. Antes de que Google lo guarde, la URL debe devolver 200, permitir el rastreo y la indexación, identificar el canonical adecuado, contener contenido distinto y poder descubrirse mediante enlaces o un sitemap. Soluciona esas “barreras” primero. Luego usa la herramienta Inspección de URL de Google Search Console para solicitar la indexación y verificar el resultado.

Barrera de indexación Lo que necesita Google Fallo común Primera solución
Respuesta del servidor HTTP 200 OK 4xx, 5xx o soft 404 Servir una página funcional con contenido real
Acceso para rastreo Googlebot puede obtener la URL Bloqueada por robots.txt Eliminar la regla Disallow relevante
Permiso de indexación Sin directiva noindex Meta robots o X-Robots-Tag indica noindex Quitar noindex, verificar en vivo y después solicitar la indexación
Canonicalización La página es la versión preferida El canonical apunta a otra parte Usar un canonical que se apunte a sí mismo cuando corresponda
Contenido Contenido HTML útil y distinto Página “thin”, vacía o casi duplicada Mejorar o consolidar el contenido
Descubrimiento Referencias mediante enlaces y sitemap Página huérfana Agregar enlaces internos e incluirla en el XML sitemap
What lets an HTML page into Google's index and what keeps it out: the six indexability gates.

La limitación más importante viene directamente de Google Search Central:

“Google no garantiza que rastreará, indexará ni mostrará tu página, incluso si tu página cumple las Google Search Essentials.”

Google añade que “la indexación no está garantizada; no todas las páginas que Google procesa se indexan”. No existe un botón de envío que anule esta decisión. Puedes hacer que la página sea accesible, fácil de descubrir, técnicamente coherente y valga la pena guardarla. Aun así, Google decide si entra al índice.

Indexar HTML ocurre a través de barreras separadas

El modelo mental útil es: rastrear, renderizar, indexar y luego servir. Son etapas distintas, no sinónimos. Si quieres los detalles más profundos, nuestra guía sobre cómo funciona la indexación en Google sigue el proceso completo.

Google descubre y rastrea la URL

Google no tiene un registro centralizado de todas las páginas publicadas en la web. Descubre URLs volviendo a visitar páginas conocidas, siguiendo enlaces y leyendo sitemaps. Luego, Googlebot solicita la URL y descarga los recursos disponibles.

Por eso un archivo HTML puede cargar perfectamente para ti y seguir invisible para Google. El servidor sabe dónde está; Google puede no saberlo. Un enlace interno y una entrada en el XML sitemap proporcionan rutas hacia la página.

Empiezo por el descubrimiento porque los desarrolladores a menudo prueban la disponibilidad y se quedan ahí. También lo hice: subí una página estática, abrí la URL, di por terminado el despliegue y luego me di cuenta de que en el sitio no había enlaces hacia ella.

Google renderiza la página

Google dice que renderiza páginas durante el rastreo y ejecuta JavaScript con una versión reciente de Chrome. Para una página HTML simple o renderizada en servidor, el contenido principal ya viene en la respuesta. Eso elimina un punto de falla: Google no necesita JavaScript del lado del cliente para construir el documento principal.

Es una ventaja, no una garantía de indexación. El HTML estático aun puede incluir un encabezado noindex, declarar un canonical incorrecto, devolver un soft 404 o estar a tres sitemaps de distancia sin enlaces internos. El renderizado simple no “salva” señales deficientes de indexación.

Google evalúa la página para indexarla

Durante la indexación, Google analiza el texto, las imágenes, el elemento title, los atributos alt y otras señales de la página. También evalúa la duplicación y elige una URL canonical a partir de versiones similares.

Un rastreo exitoso solo demuestra que Google pudo obtener el documento. Luego Google puede seleccionar otro canonical o decidir que la página no ofrece suficiente valor distinto como para almacenarla por separado.

Una página indexada pasa a ser elegible para posicionar

Indexar es admisión, no visibilidad.

Ahrefs analizó aproximadamente 14 mil millones de páginas en su base de datos Content Explorer y encontró que el 96,55% no recibió tráfico desde Google; otro 1,94% recibió entre una y diez visitas mensuales. Esto mide páginas en el índice de Ahrefs, no el índice completo de Google, así que no debería citarse mal como una cifra global de Google. Aun así, ilustra la diferencia entre estar almacenado y ser competitivo.

La checklist de indexabilidad HTML que uso

Ejecuta estas verificaciones antes de solicitar indexación. Si no, le pides a Google que vuelva a visitar el mismo fallo que sigue sin resolverse.

Confirma que la URL devuelve HTTP 200 OK

La página prevista debe devolver una respuesta 200 exitosa. Una respuesta 4xx indica que el recurso no está disponible; una 5xx indica que el servidor no pudo proporcionarlo. Ninguna de las dos ofrece a Google un documento “saludable” para indexar.

Revisa también los soft 404. Estas URLs devuelven 200 pero se parecen a páginas vacías, rotas o de “no encontrado”. Google puede tratarlas como errores. Un recurso que falta debería devolver 404 o 410; una URL indexable necesita contenido sustantivo.

No te quedes solo con lo que muestra el navegador. Una plantilla de error “bien pulida” puede ocultar una respuesta fallida, mientras que una página que se ve fea puede devolver HTML perfectamente válido (los encabezados normalmente zanjan la discusión).

Elimina todas las instrucciones noindex

Una directiva noindex puede aparecer en dos lugares:

Una noindex puede vivir en el HTML o en la respuesta HTTP, y Google obedece cualquiera:

<!-- In the page head -->
<meta name="robots" content="noindex">

# Or as an HTTP response header (same effect)
X-Robots-Tag: noindex
  • Una meta etiqueta robots en el head del HTML, como <meta name="robots" content="noindex">.
  • Un encabezado de respuesta HTTP X-Robots-Tag: noindex.

Google respeta noindex después de rastrear la página. Revisa tanto el origen (source) como los encabezados de respuesta, especialmente después de pasar de staging a producción.

Cuando Lida y yo migramos seojuice.io a seojuice.com en enero de 2026, una de nuestras primeras comprobaciones fue la respuesta en vivo de X-Robots-Tag en cada plantilla, no solo la meta tag visible. Las migraciones de dominio ya introducen redirecciones, canonicals y cambios de descubrimiento; arrastrar en silencio un encabezado de staging a producción habría dejado irrelevante el resto.

Quita noindex antes de solicitar otro rastreo. Pedirle a Google que indexe una URL que todavía se niega a indexarse es preciso pero inútil.

Asegúrate de que robots.txt permita el rastreo

robots.txt controla el rastreo. Si una ruta está prohibida, Googlebot no puede obtener el HTML, inspeccionar su contenido ni ver una directiva noindex a nivel de página.

La distinción importa: robots.txt no es un mecanismo de “eliminación” fiable. Una URL bloqueada que se descubra mediante enlaces puede seguir apareciendo como resultado de “solo URL” porque Google conoce la dirección sin que se le permita obtener el contenido. Si necesitas mantener una página fuera del índice, permite el rastreo y usa noindex.

Para una regla Disallow accidental, nuestro generador de robots.txt gratuito ayuda a crear y validar un archivo más limpio. Corrige instrucciones de rastreo; no fuerza la inclusión en Google.

Revisa la URL canonical

Si una página declara rel="canonical", normalmente debería apuntarse a sí misma a menos que realmente duplique otra URL. Un canonical que apunta a otro lugar le indica a Google que la otra dirección es la versión preferida.

Google puede elegir un canonical distinto al que declaraste. La etiqueta es una señal fuerte, no una orden. Revisa los canonicals declarados por el usuario y los seleccionados por Google en Search Console, en lugar de asumir que manda la etiqueta de origen.

Si la canonicalización te parece resbaladiza, esta explicación de qué es una URL canonical cubre los casos prácticos. Las URLs antiguas pueden requerir en su lugar redirecciones; nuestra comparación de redirecciones 301 vs 302 explica esa decisión.

Pon valor distinto en el HTML

La pregunta inmediata no es cuántas palabras tiene la página. Es si esta URL merece existir por separado de las demás URLs del sitio.

Una plantilla que solo cambia una ciudad, un servicio o una keyword puede quedarse en casi duplicado. Lo mismo pasa con “caparazones” de producto vacíos y archivos de etiquetas que repiten fragmentos disponibles en otros lugares. Agregar otras 300 palabras genéricas no repara la duplicación de fondo (ojalá pudiera calcularse como un umbral de conteo de palabras, pero no lo es).

Mejora lo que sea único: instrucciones originales, especificaciones, comparaciones, ejemplos, evidencia de primera mano o información que satisfaga una intención distinta. Si la página no puede justificar su existencia, consolídala con la URL más fuerte.

Agrega enlaces internos a la página

Enlaza la nueva página desde URLs relevantes que Google ya visita, como la home, un hub de categoría, el índice de documentación o un artículo relacionado. Usa anchor text que explique el destino.

Una página huérfana no tiene enlaces internos que apunten hacia ella. Un sitemap puede revelar la URL, pero no muestra cómo encaja la página en la estructura de información del sitio. Por lo que vemos en sitios que ejecutan SEOJuice, las páginas huérfanas y las que tienen pocos enlaces son de los problemas de descubrimiento más persistentes. No son fallos técnicos “raros”. Son páginas que nadie conectó con nada.

SEOJuice aplica continuamente enlaces internos relevantes en un sitio en vivo. No “inyecta” páginas en el índice de Google. Crea rutas de rastreo y reduce el trabajo repetitivo de encontrar contenido desconectado, que es el nivel útil de automatización para un equipo de dos personas como el nuestro.

Incluye la URL en tu XML sitemap

Lista URLs canonical e indexables en el XML sitemap y envíalo a través de Google Search Console. Google recomienda sitemaps cuando quieres indexar muchas páginas.

Un sitemap es un canal de descubrimiento, no una lista de aprobación. La URL listada aun necesita una respuesta válida, acceso para rastreo, permiso de indexación, señales canonical coherentes y contenido valioso. Piensa en el sitemap como direcciones para llegar a la puerta, no como la llave.

Cómo lograr que se indexe una página HTML

  1. Soluciona la indexabilidad. Verifica la respuesta 200, acceso para rastreo, ausencia de noindex, canonical correcto y contenido distinto.
  2. Agrega la URL canonical al XML sitemap. Envía o reenvía el sitemap en Search Console.
  3. Agrega enlaces internos. Enlaza desde páginas que sean contextualmente relevantes y que Google ya conozca.
  4. Inspecciona la URL exacta. Abre Search Console, pega la URL canonical completa en Inspección de URL y ejecuta una prueba en vivo.
  5. Solicita la indexación una sola vez. Si la URL en vivo es elegible, selecciona Request Indexing para esa página importante.
  6. Crea rutas adicionales de descubrimiento legítimas. Enlaces externos relevantes y compartir de forma normal pueden dar a Google rutas más allá de tu propio sitemap.

La documentación de Google sobre Inspección de URL dice: “La indexación puede tardar hasta una o dos semanas”. También indica que enviar una solicitud no garantiza que aparezca en el índice de Google y que hay un límite diario de solicitudes.

El Google Search Advocate John Mueller dio un rango más amplio de “varias horas a varias semanas”, según el reporte de Search Engine Land sobre la guía de AskGooglebot de junio de 2021. Recomendó que los editores enviaran un sitemap, tuvieran paciencia y recordaran que la indexación no garantiza el posicionamiento.

El rango es amplio porque esto no es una cola de publicación determinista. Una vez que pasan las verificaciones técnicas y la página tiene rutas útiles de descubrimiento, esperar puede ser la acción correcta (sé que suena injusto, pero es más útil que presionar Request Indexing por sexta vez).

Cómo comprobar si una página HTML está indexada

Usa URL Inspection para la respuesta principal

Pega la URL exacta en la herramienta de Inspección de URL de Search Console. “URL is on Google” significa que está indexada. “URL is not on Google” significa que no está indexada en este momento.

El informe principal muestra la versión indexada más recientemente, no necesariamente la página que tu sitio sirve ahora. Test Live URL hace una solicitud fresca, pero no agrega la página al índice. Por ejemplo, después de quitar noindex, la prueba en vivo podría pasar mientras que el informe indexado siga reflejando la versión bloqueada anterior.

Usa el informe de indexación de página para encontrar patrones

El informe de Page Indexing agrupa las URLs excluidas por motivo. Esto es más útil que revisar páginas una por una cuando una plantilla, un directorio o un despliegue generó el mismo problema en cientos de URLs.

Busca agrupaciones. Un conjunto repentino de exclusiones por noindex sugiere una plantilla o un encabezado compartido. El crecimiento de canonicals duplicados puede apuntar a parámetros o variantes de URL. Un grupo grande “descubierto” merece revisar la capacidad del sitio y el volumen de URLs de bajo valor; en sitios grandes, la optimización del presupuesto de rastreo se vuelve relevante.

Trata al operador del sitio como una verificación aproximada

Una búsqueda como site:example.com/page es una comprobación rápida de cordura, no un informe autoritativo del índice.

Google indica que “El operador site: no necesariamente devuelve todas las URLs que están indexadas bajo el prefijo especificado en la consulta”. Si el resultado falta, usa la Inspección de URL antes de concluir que la página está excluida.

Qué significa cada estado en Search Console

Estado Significado Qué hacer a continuación
Excluded by noindex Google encontró y obedeció una directiva noindex Elimínala, verifica la respuesta en vivo y luego solicita la indexación
Blocked by robots.txt Google no puede obtener el HTML Permite el rastreo para esa ruta
Discovered, currently not indexed Google conoce la URL, pero no la ha obtenido Revisa capacidad del sitio, enlaces, inclusión en sitemap y volumen de URLs de bajo valor
Crawled, currently not indexed Google obtuvo la página pero no la almacenó Mejora el valor distinto y resuelve duplicación o conflictos de canonical
Duplicate or alternate canonical Otra URL se seleccionó como canonical Revisa canonicals declarados, redirecciones y versiones duplicadas
Soft 404 La URL devuelve 200, pero parece una página vacía o inexistente Agrega contenido sustantivo o devuelve un 404 o 410 real

La distinción más útil es entre “discovered” y “crawled”. Discovered significa que Google conoce la URL, pero no la ha obtenido. La explicación documentada de Google dice que esto ocurre comúnmente cuando se esperaba que el rastreo sobrecargara el sitio, así que Google la reprogramó. Operativamente, los enlaces internos y la calidad de la URL siguen importando, pero no son la única causa que Google afirma.

Crawled significa que Google ya obtuvo la página y decidió no almacenarla por ahora. La documentación de Page Indexing de Google indica que “no es necesario reenviar esta URL para rastreo”. En su lugar, revisa el contenido, la duplicación y la elección del canonical. Editar una página es más difícil que hacer clic en un botón, probablemente por eso sigo teniendo que recordármelo.

La palabra “currently” importa. Ninguno de los estados es necesariamente permanente.

Dónde la automatización realmente ayuda

Ningún producto SEO puede garantizar la indexación de HTML. La automatización útil funciona debajo de esa promesa: encontrar bloqueos, conectar páginas y aplicar arreglos en todo el sitio de forma consistente.

SEOJuice aplica continuamente enlaces internos, títulos y descripciones meta, marcado schema y texto alt de imágenes en sitios en vivo. Su auditoría puede detectar directivas noindex y bloqueos en robots.txt. Estos son cambios concretos para el descubrimiento y la indexabilidad, no un servicio de “indexa ahora”.

Si las páginas huérfanas y las directivas accidentales siguen apareciendo, el plan gratuito de SEOJuice te permite probar ese flujo de trabajo sin tarjeta de crédito. La decisión de indexación la mantiene Google; nosotros automatizamos el trabajo repetitivo en el sitio que rodea ese punto.

Preguntas frecuentes

¿Cómo puedo conseguir que Google indexe una página HTML?

Asegúrate de que devuelva 200, que no tenga directiva noindex, que sea rastreable, que use el canonical correcto y que contenga contenido distinto. Añádela al XML sitemap, enlázala internamente y, después, usa la herramienta de Inspección de URL de Search Console para solicitar la indexación.

¿Cómo compruebo si mi página HTML está indexada?

Usa URL Inspection en Google Search Console. “URL is on Google” significa indexada. El operador site: solo sirve como comprobación aproximada porque Google dice que no necesariamente devuelve todas las URLs que están indexadas.

¿Cuánto tarda Google en indexar una página nueva?

No hay un plazo garantizado. John Mueller dijo que la indexación puede tardar desde varias horas hasta varias semanas. La documentación de Search Console indica que la indexación solicitada puede tardar hasta una o dos semanas.

¿Por qué mi página aparece como “Crawled, currently not indexed”?

Google obtuvo la página, pero eligió no almacenarla por ahora. Revisa si ofrece valor distinto, si duplica otra página o si apunta a un canonical diferente. Google dice que no hace falta reenviarla solo por el rastreo.

¿robots.txt impide que una página se indexe?

No de forma fiable. robots.txt bloquea el rastreo, pero una URL bloqueada que se descubra mediante enlaces puede seguir apareciendo sin su contenido. Para evitar la indexación, permite que Google rastree la página y añade una directiva noindex.

¿Necesito un XML sitemap para que se indexe?

No. Google puede descubrir páginas siguiendo enlaces. Un sitemap sigue siendo la forma más limpia de divulgar canonicals a escala, y Google recomienda enviar uno cuando quieres indexar muchas páginas.

Devuelve el contenido traducido en

SEOJuice
Stay visible everywhere
Get discovered across Google and AI platforms with research-based optimizations.
Works with any CMS
Automated Internal Links
On-Page SEO Optimizations
Get Started Free

no credit card required

More articles

No related articles found.