seojuice

Come le pagine HTML vengono indicizzate da Google

Vadim Kravcenko
Vadim Kravcenko
· Updated · 9 min read

TL;DR: Pubblicare un file HTML lo rende disponibile solo sul tuo server. Prima che Google lo salvi, l’URL deve rispondere con 200, permettere crawling e indicizzazione, identificare il canonical corretto, contenere contenuti distinti e risultare raggiungibile tramite link o sitemap. Sistemi questi “cancelli” prima. Poi usa lo strumento Ispezione URL di Google Search Console per richiedere l’indicizzazione e verificare l’esito.

Gates di indicizzazione Cosa serve a Google Errore comune Prima correzione
Risposta del server HTTP 200 OK 4xx, 5xx oppure soft 404 Servi una pagina funzionante con contenuto reale
Accesso al crawling Googlebot deve poter recuperare l’URL Bloccato da robots.txt Rimuovi la regola Disallow pertinente
Permesso di indicizzazione Nessuna direttiva noindex Meta robots oppure X-Robots-Tag indica noindex Rimuovi noindex, verifica live, poi richiedi l’indicizzazione
Canonicalizzazione La pagina è la versione preferita Canonical che punta altrove Usa un canonical self-referencing quando appropriato
Contenuto Contenuto HTML utile e distintivo Pagina sottile, vuota o quasi duplicata Migliora o consolida il contenuto
Discovery Link e riferimenti via sitemap Pagina orfana Aggiungi link interni e includila nella sitemap XML
Cosa permette a una pagina HTML di entrare nell’indice di Google e cosa invece lo impedisce: le sei porte dell’indicizzabilità.

Il vincolo più importante arriva direttamente da Google Search Central:

“Google non garantisce che eseguirà il crawling, indicizzerà o mostrerà la tua pagina, anche se la tua pagina segue le Google Search Essentials.”

Google aggiunge che “l’indicizzazione non è garantita; non tutte le pagine che Google elabora verranno indicizzate”. Non esiste un pulsante di submission che possa ribaltare questa decisione. Puoi rendere la pagina accessibile, facile da scoprire, tecnicamente coerente e degna di essere salvata. Resta comunque Google a decidere se entrerà nell’indice.

L’indicizzazione HTML avviene tramite gate separati

Il modello mentale utile è: crawling, render, index, poi serve. Sono fasi distinte, non sinonimi. Se vuoi i dettagli più tecnici, la nostra guida su come funziona l’indicizzazione di Google segue l’intera pipeline.

Google scopre e fa crawling dell’URL

Google non ha un registro centrale di ogni pagina pubblicata sul web. Scopre gli URL tornando su pagine note, seguendo link e leggendo le sitemap. Poi Googlebot richiede l’URL e scarica le risorse disponibili.

Ecco perché un file HTML può caricarsi perfettamente per te e restare invisibile a Google. Il server sa dove si trova; Google potrebbe no. Un link interno e una voce nella XML sitemap forniscono le strade per arrivare alla pagina.

Parto dalla discovery perché gli sviluppatori spesso testano la disponibilità e si fermano lì. L’ho fatto anch’io: caricare una pagina statica, aprire l’URL, “fine del rilascio”, poi accorgersi che nel sito non c’è alcun link verso quella pagina.

Google esegue il rendering della pagina

Google dice che esegue il rendering delle pagine durante il crawling e che usa JavaScript tramite una versione recente di Chrome. Per una pagina HTML semplice o server-rendered, il contenuto principale è già nella risposta. Questo elimina un possibile punto di fallimento: a Google non serve JavaScript lato client per costruire il documento principale.

È un vantaggio, non una garanzia di indicizzazione. L’HTML statico può comunque includere un header noindex, dichiarare il canonical sbagliato, restituire una soft 404 oppure stare a tre file di sitemap di distanza senza link interni. Un rendering “semplice” non salva segnali di indicizzazione scarsi.

Google valuta la pagina per l’indicizzazione

Durante l’indicizzazione, Google analizza testo, immagini, elemento title, attributi alt e altri segnali della pagina. Valuta anche la duplicazione e sceglie un URL canonical partendo da versioni simili.

Un crawling riuscito dimostra solo che Google avrebbe potuto recuperare il documento. Poi Google potrebbe selezionare un canonical diverso o decidere che la pagina non offre abbastanza valore distintivo da essere salvata separatamente.

Una pagina indicizzata diventa eleggibile al ranking

L’indicizzazione è ammissione, non visibilità.

Ahrefs ha analizzato circa 14 miliardi di pagine nel proprio database Content Explorer e ha scoperto che il 96,55% non ha ricevuto traffico da Google; un ulteriore 1,94% ha ricevuto tra una e dieci visite mensili. Questo misura pagine presenti nell’indice di Ahrefs, non l’indice completo di Google, quindi non va citato come cifra valida “per Google in generale”. Ma dimostra comunque la differenza tra “essere salvati” ed “essere competitivi”.

La checklist di indicizzabilità HTML che uso

Esegui questi controlli prima di richiedere l’indicizzazione. Altrimenti stai chiedendo a Google di rivisitare la stessa causa di fallimento irrisolta.

Verifica che l’URL restituisca HTTP 200 OK

La pagina destinata dovrebbe rispondere con un 200 di successo. Una risposta 4xx indica che la risorsa non è disponibile; una 5xx indica che il server non è riuscito a fornirla. In entrambi i casi non offrono a Google un documento “sano” da indicizzare.

Controlla anche le soft 404. Questi URL restituiscono 200, ma assomigliano a pagine vuote, rotte o “non trovate”. Google potrebbe trattarle come errori. Una risorsa mancante dovrebbe restituire 404 o 410; un URL indicizzabile deve contenere contenuto sostanziale.

Non affidarti solo a ciò che mostra il browser. Un template di errore ben rifinito può nascondere una risposta fallita, mentre una pagina “brutta” potrebbe comunque restituire HTML perfettamente valido (di solito sono gli header a risolvere la questione).

Rimuovi ogni istruzione noindex

Una direttiva noindex può comparire in due punti:

  • Un meta tag robots nell’HTML head, ad esempio <meta name="robots" content="noindex">.
  • Un header HTTP X-Robots-Tag: noindex.

Google obbedisce a noindex dopo il crawling della pagina. Controlla sia il sorgente sia gli header della risposta, soprattutto dopo il passaggio da staging a produzione.

Quando io e Lida abbiamo migrato seojuice.io su seojuice.com a gennaio 2026, uno dei primi controlli è stato la risposta live dell’X-Robots-Tag su ogni template, non solo il meta tag visibile. Le migrazioni di dominio introducono già redirect, canonicals e cambi di discovery; tenere silenziosamente un header di staging in produzione avrebbe reso irrilevante il resto.

Rimuovi noindex prima di richiedere un nuovo crawling. Chiedere a Google di indicizzare un URL che rifiuta ancora l’indicizzazione è preciso ma inutile.

Assicurati che robots.txt permetta il crawling

Robots.txt controlla il crawling. Se un percorso è disabilitato, Googlebot non può recuperare l’HTML, ispezionare il contenuto o vedere una direttiva noindex a livello di pagina.

La distinzione conta: robots.txt non è un meccanismo di rimozione affidabile. Un URL bloccato scoperto tramite link può comunque comparire come risultato “URL-only”, perché Google conosce l’indirizzo senza poter recuperare i contenuti. Se devi tenere una pagina fuori dall’indice, consenti il crawling e usa noindex.

Per una regola Disallow accidentale, il nostro generatore robots.txt gratuito aiuta a creare e validare un file più pulito. Corregge le istruzioni di crawling; non forza l’inclusione su Google.

Controlla l’URL canonical

Se una pagina dichiara rel="canonical", di norma dovrebbe puntare a se stessa a meno che non duplichi davvero un altro URL. Un canonical che punta altrove dice a Google che quell’altro indirizzo è la versione preferita.

Google può scegliere un canonical diverso da quello che dichiari tu. Il tag è un segnale forte, non un ordine. Controlla i canonical “dichiarati dall’utente” e quelli “selezionati da Google” in Search Console, invece di presumere che conti solo il tag sorgente.

Se la canonicalizzazione ti sembra scivolosa, questa spiegazione di che cos’è un canonical URL copre i casi pratici. Gli URL vecchi potrebbero invece richiedere redirect; il nostro confronto 301 vs 302 redirect spiega come decidere.

Metti valore distintivo nell’HTML

La domanda immediata non è quante parole contiene la pagina. È se questo URL merita di esistere separatamente dagli altri URL del sito.

Un template che cambia una città, un servizio o una keyword può rimanere una quasi-duplicazione. Lo stesso vale per i gusci prodotto vuoti e per le archive tag che ripetono snippet già disponibili altrove. Aggiungere altre 300 parole generiche non ripara la duplicazione di fondo (vorrei poterlo calcolare come una soglia di conteggio parole, ma non è così).

Migliora ciò che è unico: istruzioni originali, specifiche, confronti, esempi, prove dirette, oppure informazioni che soddisfano un intento distinto. Se la pagina non riesce a giustificarsi, consolidala con l’URL più forte.

Inserisci link interni alla pagina

Collega la nuova pagina da URL rilevanti che Google visita già, come la homepage, un hub di categoria, un indice di documentazione o un articolo correlato. Usa anchor text che spiega la destinazione.

Una pagina orfana non ha link interni che puntano a lei. Una sitemap può rendere visibile l’URL, ma non mostra come la pagina si inserisce nella struttura informativa del sito. Da quello che vediamo lavorando con siti che usano SEOJuice, pagine orfane e pagine collegate debolmente sono tra i problemi di discovery più persistenti. Non sono fallimenti tecnici “esotici”. Sono semplicemente pagine collegate a nulla.

SEOJuice applica continuamente in modo automatico link interni rilevanti su un sito live. Non inietta pagine nell’indice di Google. Crea percorsi di crawling e riduce il lavoro ripetitivo di trovare contenuti scollegati: è il livello utile di automazione per un team di due persone come il nostro.

Includi l’URL nella tua XML sitemap

Elenca nella XML sitemap gli URL canonici indicizzabili e inviala tramite Google Search Console. Google raccomanda le sitemap quando vuoi indicizzare molte pagine.

Una sitemap è un feed di discovery, non una lista di approvazione. L’URL indicato deve comunque avere una risposta valida, accesso al crawling, permesso di indicizzazione, segnali canonical coerenti e contenuto davvero utile. Pensa alla sitemap come a indicazioni per arrivare alla porta, non come alla chiave.

Come far indicizzare una pagina HTML

  1. Risolvi l’indicizzabilità. Verifica la risposta 200, l’accesso al crawling, l’assenza di noindex, il canonical corretto e contenuto distintivo.
  2. Aggiungi l’URL canonical alla XML sitemap. Invia o reinvia la sitemap in Search Console.
  3. Aggiungi link interni. Collega da pagine rilevanti che Google conosce già.
  4. Ispeziona l’URL esatto. Apri Search Console, incolla l’URL canonical completo in Ispezione URL e avvia un test live.
  5. Richiedi l’indicizzazione una sola volta. Se l’URL live è eleggibile, seleziona “Richiedi indicizzazione” per quella pagina importante.
  6. Crea percorsi di discovery legittimi aggiuntivi. Link esterni pertinenti e condivisioni normali possono dare a Google strade oltre la tua sitemap.

La documentazione di Google sull’URL Inspection dice che “l’indicizzazione può richiedere fino a una o due settimane”. Inoltre specifica che inviare una richiesta non garantisce la comparsa nell’indice Google e che esiste un limite giornaliero alle richieste.

Google Search Advocate John Mueller ha fornito un intervallo più ampio di “da diverse ore a diverse settimane”, secondo la copertura di Search Engine Land sulla guida AskGooglebot di giugno 2021. Ha consigliato agli editori di inviare una sitemap, di avere pazienza e di ricordare che l’indicizzazione non garantisce il ranking.

L’intervallo è ampio perché non è una coda di pubblicazione deterministica. Una volta che i controlli tecnici passano e la pagina ha percorsi di discovery utili, aspettare può essere l’azione corretta (non soddisfa, lo so, ma è più utile che premere “Richiedi indicizzazione” per la sesta volta).

Come verificare se una pagina HTML è indicizzata

Usa URL Inspection per la risposta principale

Incolla l’URL esatto nello strumento Ispezione URL di Search Console. “L’URL è su Google” significa che è indicizzato. “L’URL non è su Google” significa che al momento non è indicizzato.

Il report principale mostra la versione indicizzata più di recente, non necessariamente la pagina che il tuo sito sta servendo ora. La funzione “Test Live URL” esegue un fetch aggiornato ma non aggiunge la pagina all’indice. Dopo aver rimosso noindex, ad esempio, il test live può superarsi mentre il report “indicizzato” continua a riflettere la vecchia versione bloccata.

Usa il report di indicizzazione della pagina per trovare pattern

Il report “Page Indexing” raggruppa gli URL esclusi per motivo. È più utile che ispezionare le pagine una a una quando un template, una directory o una deploy hanno creato lo stesso problema su centinaia di URL.

Cerca cluster. Un improvviso set di esclusioni noindex suggerisce un template o un header condiviso. L’aumento dei canonical duplicati può indicare parametri o varianti di URL. Un gruppo grande “scoperto” merita una revisione della capacità del sito e del volume di URL a basso valore; su siti più grandi, diventa rilevante l’ottimizzazione del crawl budget.

Tratta l’operatore site: come un controllo grossolano

Una ricerca tipo site:example.com/page è un controllo rapido di buon senso, non un report autorevole dell’indice.

Google dichiara che “L’operatore site: non necessariamente restituisce tutti gli URL indicizzati sotto il prefisso specificato nella query”. Se il risultato manca, usa URL Inspection prima di concludere che la pagina sia esclusa.

Cosa significa ogni stato in Search Console

Stato Significato Cosa fare dopo
Esclusa per noindex Google ha trovato e rispettato una direttiva noindex Rimuovila, verifica la risposta live, poi richiedi l’indicizzazione
Bloccata da robots.txt Google non può recuperare l’HTML Consenti il crawling per quel percorso
Scoperta, attualmente non indicizzata Google conosce l’URL ma non l’ha ancora recuperato Controlla capacità del sito, link, inclusione in sitemap e volume di URL a basso valore
Effettuato crawling, attualmente non indicizzata Google ha recuperato la pagina ma non l’ha memorizzata Migliora valore distintivo e risolvi duplicazioni o conflitti di canonical
Canonical duplicato o alternativo Un altro URL è stato selezionato come canonical Rivedi i canonical dichiarati, i redirect e le versioni duplicate
Soft 404 L’URL restituisce 200 ma sembra una pagina vuota o mancante Aggiungi contenuto sostanziale oppure restituisci un vero 404 o 410

La distinzione più utile è tra “scoperta” e “effettuato crawling”. Scoperta significa che Google conosce l’URL ma non l’ha ancora recuperato. La spiegazione documentata da Google indica che questo accade spesso quando ci si aspetta che il crawling sovraccarichi il sito, quindi Google lo ripianifica. Operativamente contano comunque link interni e qualità dell’URL, ma non sono le uniche cause dichiarate da Google.

Effettuato crawling significa che Google ha già recuperato la pagina e ha scelto di non salvarla per ora. La documentazione sull’indicizzazione delle pagine di Google afferma che “non c’è bisogno di reinviare questo URL per il crawling”. Ispeziona invece contenuto, duplicazione e scelta del canonical. Modificare la pagina è più difficile che cliccare un pulsante, ed è probabilmente per questo che continuo a dovermelo ricordare.

Conta la parola “attualmente”. Nessuno dei due stati è necessariamente permanente.

Dove l’automazione aiuta davvero

Nessun prodotto SEO può garantire l’indicizzazione dell’HTML. L’automazione utile lavora sotto quella promessa: individuare i blocchi, collegare le pagine e applicare fix sul sito in modo consistente.

SEOJuice applica continuamente in automatico link interni, meta title e descrizioni, schema markup e testo alt delle immagini su siti live. Il suo audit può far emergere direttive noindex e blocchi robots.txt. Sono miglioramenti concreti a discovery e indicizzabilità, non un servizio “indicizza ora”.

Se pagine orfane e direttive accidentali continuano a ripresentarsi, il piano free di SEOJuice ti permette di testare quel flusso di lavoro senza carta di credito. La decisione sull’indicizzazione resta a Google; noi automatizziamo il lavoro ripetitivo on-site attorno a quella decisione.

Domande frequenti

Come faccio a far indicizzare una pagina HTML da Google?

Assicurati che risponda con 200, non abbia direttive noindex, sia crawlable, usi il canonical corretto e contenga contenuto distintivo. Includila nella XML sitemap, collegala internamente e poi usa lo strumento Ispezione URL di Search Console per richiedere l’indicizzazione.

Come verifico se la mia pagina HTML è indicizzata?

Usa URL Inspection in Google Search Console. “L’URL è su Google” significa indicizzato. L’operatore site: è solo un controllo grossolano, perché Google dice che non necessariamente restituisce tutti gli URL indicizzati.

Quanto tempo serve a Google per indicizzare una nuova pagina?

Non esiste una tempistica garantita. John Mueller ha detto che l’indicizzazione può richiedere da diverse ore a diverse settimane. La documentazione di Search Console dice che l’indicizzazione richiesta può richiedere fino a una o due settimane.

Perché la mia pagina è “Effettuato crawling, attualmente non indicizzata”?

Google ha recuperato la pagina ma ha scelto di non salvarla per ora. Controlla se offre valore distintivo, se duplica un’altra pagina o se punta a un canonical diverso. Google dice che non c’è bisogno di reinviarla solo per il crawling.

robots.txt impedisce l’indicizzazione di una pagina?

Non in modo affidabile. Robots.txt blocca il crawling, ma un URL bloccato scoperto tramite link può comunque comparire senza i suoi contenuti. Per evitare l’indicizzazione, consenti a Google di fare crawling della pagina e aggiungi una direttiva noindex.

Ho bisogno di una XML sitemap per essere indicizzato?

No. Google può scoprire le pagine seguendo link. Una sitemap resta il modo più pulito per dichiarare i canonical su larga scala, e Google consiglia di inviarne una quando vuoi indicizzare molte pagine.