seojuice

Hoe HTML-pagina’s door Google worden geïndexeerd

Vadim Kravcenko
Vadim Kravcenko
· Updated · 9 min read

TL;DR: Door alleen een HTML-bestand te publiceren, wordt het nog niet opgenomen in de index. Voordat Google het opslaat, moet de URL 200 retourneren, crawl en indexering toestaan, de juiste canonical identificeren, unieke content bevatten en vindbaar zijn via links of een sitemap. Repareer die barrières eerst. Gebruik daarna de URL-inspectietool van Google Search Console om indexering aan te vragen en te controleren of dat werkt.

Indexering-poort Wat Google nodig heeft Meest voorkomende fout Eerste fix
Serverrespons HTTP 200 OK 4xx, 5xx of soft 404 Lever een werkende pagina met echte content
Crawl-toegang Googlebot kan de URL ophalen Geblokkeerd door robots.txt Verwijder de relevante Disallow-regel
Toestemming voor indexering Geen noindex-directive Meta robots of X-Robots-Tag zegt noindex Verwijder noindex, verifieer live, en vraag daarna indexering aan
Canonicalisatie De pagina is de geprefereerde versie Canonical wijst ergens anders heen Gebruik een self-referencing canonical waar dat passend is
Content Nuttige, unieke HTML-content Dunne, lege of bijna-duplicate pagina Verbeter of consolideer de content
Ontdekbaarheid Links en sitemap-verwijzingen Wees/Orphan-pagina Voeg interne links toe en neem op in de XML-sitemap
Wat laat een HTML-pagina toe tot de index van Google en wat houdt het tegen: de zes indexability-gates.

De belangrijkste beperking komt rechtstreeks van Google Search Central:

“Google garandeert niet dat het je pagina zal crawlen, indexeren of serveren, zelfs niet als je pagina de Google Search Essentials volgt.”

Google voegt eraan toe dat “indexering niet gegarandeerd is; niet elke pagina die Google verwerkt, wordt geïndexeerd.” Er is geen submit-knop die die beslissing kan omzeilen. Je kunt de pagina toegankelijk maken, makkelijk vindbaar, technisch consistent en de moeite waard om op te slaan. Maar Google beslist nog steeds of de pagina in de index terechtkomt.

Indexeren van HTML gaat via aparte poorten

Het handige mentale model is crawl, render, index, en daarna serve. Dat zijn aparte fases, geen synoniemen. Als je de diepere werking wilt, volgt onze gids over hoe Google indexing werkt de volledige pipeline.

Google ontdekt en crawlt de URL

Google heeft geen centrale registratie van elke pagina die op het web is gepubliceerd. Het ontdekt URL’s door bekende pagina’s opnieuw te bezoeken, links te volgen en sitemaps te lezen. Vervolgens vraagt Googlebot de URL op en downloadt het de beschikbare resources.

Daarom kan een HTML-bestand voor jou perfect laden en toch onzichtbaar blijven voor Google. De server “weet” waar het bestand staat; Google mogelijk niet. Een interne link en een XML-sitemapvermelding bieden routes naar de pagina.

Ik begin met ontdekking, omdat ontwikkelaars vaak beschikbaarheid testen en daar stoppen. Ik heb het zelf ook gedaan: een statische pagina uploaden, de URL openen, de release afsluiten, en dan pas merken dat er op de site nergens intern naar wordt gelinkt.

Google rendert de pagina

Google zegt dat het tijdens het crawlen pagina’s rendert en JavaScript draait met een recente versie van Chrome. Voor een gewone of server-rendered HTML-pagina zit de primaire content al in de response. Dat haalt één mogelijke faalplek weg: Google heeft geen client-side JavaScript nodig om het hoofddocument op te bouwen.

Dat is een voordeel, geen garantie voor indexering. Statische HTML kan nog steeds een noindex-header bevatten, een verkeerde canonical aangeven, een soft 404 teruggeven of drie sitemapbestanden verderop staan zonder interne links. Simpele rendering redt geen slechte indexing-signalen.

Google beoordeelt de pagina voor indexering

Tijdens indexering analyseert Google tekst, afbeeldingen, het title-element, alt-attributen en andere pagesignalen. Het beoordeelt ook duplicatie en kiest vervolgens een canonical-URL op basis van vergelijkbare varianten.

Een succesvolle crawl bewijst alleen dat Google het document kon ophalen. Daarna kan Google een andere canonical kiezen of concluderen dat de pagina onvoldoende unieke waarde biedt om apart op te slaan.

Een geïndexeerde pagina komt in aanmerking om te ranken

Indexering is toelating, geen zichtbaarheid.

Ahrefs analyseerde in zijn Content Explorer-database grofweg 14 miljard pagina’s en vond dat 96,55% geen verkeer kreeg van Google; nog eens 1,94% kreeg tussen één en tien bezoeken per maand. Dit meet pagina’s in de Ahrefs-index, niet de volledige Google-index, dus het is geen correcte “Google-brede” claim. Het laat wel het verschil zien tussen opgeslagen zijn en competitief genoeg zijn.

De HTML-indexability-checklist die ik gebruik

Voer deze checks uit voordat je indexering aanvraagt. Anders vraag je Google om opnieuw naar dezelfde, nog niet opgeloste faaloorzaak te kijken.

Controleer of de URL HTTP 200 OK retourneert

De bedoelde pagina moet een succesvolle 200-response geven. Een 4xx zegt dat de resource niet beschikbaar is; een 5xx zegt dat de server faalde om het te leveren. Geen van beide levert Google een “gezond” document om te indexeren.

Check ook soft 404’s. Deze URL’s geven 200 terug, maar lijken op lege, kapotte of “niet gevonden”-pagina’s. Google kan ze als fouten behandelen. Een ontbrekende resource zou 404 of 410 moeten teruggeven; een URL die je wél wilt indexeren moet inhoud bevatten die er echt toe doet.

Ga niet alleen af op wat de browser toont. Een nette error-template kan een falende response verbergen, terwijl een pagina die er lelijk uitziet alsnog perfect geldige HTML kan teruggeven (headers zetten het meestal snel recht).

Verwijder elke noindex-instructie

Een noindex-directive kan op twee plekken voorkomen:

Een noindex kan in de HTML staan of in de HTTP-response, en Google volgt beide:

<!-- In the page head -->
<meta name="robots" content="noindex">

# Or as an HTTP response header (same effect)
X-Robots-Tag: noindex
  • Een robots meta tag in de HTML-head, zoals <meta name="robots" content="noindex">.
  • Een X-Robots-Tag: noindex HTTP-response header.

Google volgt noindex nadat het de pagina heeft gecrawld. Check dus zowel de bron als de response-headers, zeker na een migratie van staging naar productie.

Toen Lida en ik seojuice.io in januari 2026 migreerden naar seojuice.com, was één van onze eerste checks de live X-Robots-Tag-response op elke template, niet alleen de zichtbare meta tag. Domeinmigraties introduceren al redirects, canonicals en discoverability-wijzigingen; een staging-header die stilletjes in productie terechtkomt, maakt de rest irrelevant.

Verwijder noindex voordat je om een nieuwe crawl vraagt. Google vragen om een URL te indexeren die nog steeds indexatie weigert is precies, maar vooral zinloos.

Zorg dat robots.txt crawl-toegang toestaat

Robots.txt stuurt crawl. Als een pad is disallowed, kan Googlebot de HTML niet ophalen, de content niet inspecteren en ook geen pagina-level noindex-directive zien.

Het verschil is belangrijk: robots.txt is geen betrouwbare “remove”-oplossing. Een geblokkeerde URL die via links wordt ontdekt, kan toch verschijnen als een “URL-only”-resultaat, omdat Google het adres kent zonder de inhoud te mogen ophalen. Als je een pagina buiten de index wilt houden, laat crawl toe en gebruik noindex.

Voor een per ongeluk ingestelde Disallow-regel helpt onze gratis robots.txt generator om een schoner bestand te maken en te valideren. Het repareert crawl-instructies; het forceert geen opname in Google.

Controleer de canonical-URL

Als een pagina rel="canonical" declareert, zou die in de meeste gevallen naar zichzelf moeten verwijzen, tenzij hij echt een andere URL dupliceert. Een canonical die naar elders wijst, vertelt Google dat het andere adres de geprefereerde versie is.

Google kan een andere canonical kiezen dan degene die jij opgeeft. De tag is een sterk signaal, geen bevel. Check in Search Console zowel de user-declared canonicals als de canonicals die Google selecteert, in plaats van blind op de bron-tag te vertrouwen.

Als canonicalisatie voelt als glibberen, dan dekt deze uitleg over wat een canonical URL is de praktische scenario’s. Oude URL’s moeten soms in plaats daarvan redirects krijgen; onze vergelijking 301 vs 302 redirects legt uit wanneer.

Zet distinct waarde in de HTML

De directe vraag is niet hoeveel woorden de pagina bevat. Het is de vraag of deze URL apart moet bestaan ten opzichte van de andere URL’s op de site.

Een template die één stad, service of keyword wisselt, kan nog steeds een bijna-duplicate blijven. Hetzelfde geldt voor lege product-skeletjes en tag-archieven die snippets herhalen die elders al beschikbaar zijn. Nog eens 300 generieke woorden toevoegen lost de onderliggende duplicatie niet op (ik wou dat dit als een woord-tellingdrempel berekenbaar was, maar dat is het niet).

Verbeter wat uniek is: originele instructies, specificaties, vergelijkingen, voorbeelden, first-hand bewijs of informatie die een afzonderlijke intentie afdekt. Als de pagina zichzelf niet kan onderbouwen, consolideer hem dan met de sterkere URL.

Geef de pagina interne links

Link vanuit relevante URL’s waar Google al langskomt, zoals een homepage, categorie-hub, documentatie-index of een gerelateerd artikel. Gebruik anchortekst die uitlegt waar de link naartoe gaat.

Een wees/Orphan-pagina heeft geen interne links die naar de pagina wijzen. Een sitemap kan de URL wel “onthullen”, maar laat niet zien hoe die pagina in de informatiearchitectuur van de site past. Wat we zien over sites die SEOJuice draaien: orphaned en zwak gelinkte pagina’s horen bij de hardnekkigste discoverability-problemen. Geen exotische technische foutjes. Gewoon pagina’s waar niemand ergens aan vastzit.

SEOJuice past continu automatisch relevante interne links toe op een live site. Het injecteert geen pagina’s in de index van Google. Het creëert crawl-routes en vermindert het repetitieve werk van het vinden van losgekoppelde content—dat is het nuttige automatiseringsniveau voor een twee-persoons team zoals het onze.

Neem de URL op in je XML-sitemap

Vermeld canonical, indexeerbare URL’s in de XML-sitemap en dien hem in via Google Search Console. Google raadt sitemaps aan wanneer je veel pagina’s geïndexeerd wilt hebben.

Een sitemap is een discoverability-feed, geen goedkeuringslijst. De opgesomde URL moet alsnog een geldige response hebben, crawl-toegang, index-toestemming, consistente canonical-signalen en content die het waard is. Zie de sitemap als aanwijzingen naar de deur, niet als de sleutel.

Hoe krijg je een HTML-pagina geïndexeerd?

  1. Repareer indexability. Verifieer de 200-response, crawl-toegang, afwezigheid van noindex, de juiste canonical en distinct content.
  2. Voeg de canonical URL toe aan je XML-sitemap. Dien de sitemap in of dien hem opnieuw in via Search Console.
  3. Voeg interne links toe. Link vanuit contextueel relevante pagina’s die Google al kent.
  4. Inspecteer de exacte URL. Open Search Console, plak de volledige canonical URL in URL Inspection en voer een live test uit.
  5. Vraag één keer indexering aan. Als de live URL in aanmerking komt, kies dan Request Indexing voor die belangrijke pagina.
  6. Maak legitieme extra discoverability-routes. Relevante externe links en normale sharing geven Google routes buiten je eigen sitemap.

De documentatie van Google over URL Inspection zegt: “Indexering kan tot een week of twee duren.” Het vermeldt ook dat een indexeer-aanvraag niet garandeert dat je pagina in de Google-index verschijnt en dat er een dagelijkse limiet is voor aanvragen.

Google Search Advocate John Mueller gaf een bredere bandbreedte van “van enkele uren tot meerdere weken”, volgens de reporting van Search Engine Land over Google’s AskGooglebot-guidance in juni 2021. Hij adviseerde publishers om een sitemap in te dienen, geduld te hebben en te onthouden dat indexering niet garandeert dat je ook rankt.

De bandbreedte is breed omdat dit geen deterministische publicatiequeue is. Zodra de technische checks slagen en de pagina nuttige discoverability-routes heeft, kan wachten de juiste actie zijn (ik weet het, niet bevredigend, maar nuttiger dan zes keer achter elkaar Request Indexing indrukken).

Hoe check je of een HTML-pagina geïndexeerd is

Gebruik URL Inspection voor het belangrijkste antwoord

Plak de exacte URL in de URL Inspection-tool van Search Console. “URL is op Google” betekent dat hij geïndexeerd is. “URL is niet op Google” betekent dat hij op dit moment niet geïndexeerd is.

Het hoofdrapport toont de meest recent geïndexeerde versie, niet noodzakelijk de pagina die je site nu serveert. Test Live URL voert een verse fetch uit maar voegt de pagina niet toe aan de index. Nadat je bijvoorbeeld noindex hebt verwijderd, kan de live test slagen terwijl het indexed-rapport nog de oudere geblokkeerde versie weerspiegelt.

Gebruik het Page Indexing-rapport om patronen te vinden

Het Page Indexing-rapport groepeert uitgesloten URL’s op reden. Dat is nuttiger dan pagina’s stuk voor stuk inspecteren wanneer een template, directory of deployment hetzelfde probleem over honderden URL’s heeft veroorzaakt.

Let op clusters. Een plotselinge set noindex-uitsluitingen wijst vaak op een gedeelde template of header. Een groei in duplicate-canonicals kan wijzen op parameters of URL-varianten. Een grote “discovered”-groep verdient een check van de sitecapaciteit en de hoeveelheid low-value URL’s; op grotere sites wordt crawl budget optimalisatie relevant.

Behandel de site-operator als een grove check

Een search zoals site:example.com/page is een snelle sanity check, geen autoritatieve indexrapportage.

Google stelt dat “de site:-operator niet noodzakelijk alle URL’s teruggeeft die onder de opgegeven query-prefix zijn geïndexeerd.” Als het resultaat ontbreekt, gebruik dan URL Inspection voordat je concludeert dat de pagina is uitgesloten.

Wat elke Search Console-status betekent

Status Betekenis Wat te doen
Uitgesloten door noindex Google vond en volgde een noindex-directive Verwijder het, verifieer de live response en vraag daarna indexering aan
Geblokkeerd door robots.txt Google kan de HTML niet ophalen Sta crawl toe voor dat pad
Ontdekt, momenteel niet geïndexeerd Google kent de URL maar heeft hem nog niet opgehaald Check sitecapaciteit, links, opname in sitemap en volume aan low-value URL’s
Gecrawld, momenteel niet geïndexeerd Google heeft de pagina opgehaald maar opgeslagen niet gedaan Verbeter distinct waarde en los duplicatie- of canonical-conflicten op
Duplicate of alternate canonical Een andere URL is geselecteerd als canonical Review de gedeclareerde canonicals, redirects en duplicate varianten
Soft 404 De URL geeft 200 terug maar lijkt op een lege of ontbrekende pagina Voeg inhoud toe die echt iets doet, of geef een echte 404 of 410 terug

Het meest bruikbare onderscheid is tussen “ontdekt” en “gecrawld”. Ontdekt betekent dat Google de URL kent maar hem nog niet heeft opgehaald. Google’s gedocumenteerde uitleg zegt dat dit vaak gebeurt wanneer crawl naar verwachting de site overbelast, waarna Google het opnieuw plant. Interne links en URL-kwaliteit blijven operationeel belangrijk, maar het is niet de enige, expliciet genoemde oorzaak.

Gecrawld betekent dat Google de pagina al heeft opgehaald en deze nu niet opslaat. Google’s Page Indexing-documentatie zegt dat er “geen noodzaak is om deze URL opnieuw in te dienen voor crawling.” Inspecteer in plaats daarvan content, duplicatie en de canonical-keuze. Een pagina aanpassen is lastiger dan op een knop klikken—waarschijnlijk is dat de reden dat ik mezelf dit nog steeds moet herinneren.

Het woord “momenteel” telt. Geen van beide statussen is per definitie permanent.

Waar automatisering echt helpt

Geen enkel SEO-product kan HTML-indexering garanderen. Nuttige automatisering werkt onder die belofte: het vinden van blockers, het verbinden van pagina’s en consequent site-brede fixes doorvoeren.

SEOJuice past continu automatisch interne links, meta titles en descriptions, schema markup en image alt-tekst toe op live sites. De audit kan noindex-directives en robots.txt-blokkades aan het licht brengen. Dit zijn concrete verbeteringen voor discoverability en indexability, geen “index now”-service.

Als orphan pages en per ongeluk ingevoerde directives steeds terugkomen, laat het SEOJuice free plan je die workflow testen zonder creditcard. Google behoudt de indexeringsbeslissing; wij automatiseren het repetitieve werk op de site eromheen.

Veelgestelde vragen

Hoe krijg ik een HTML-pagina geïndexeerd door Google?

Zorg dat hij 200 retourneert, geen noindex-directive heeft, crawlbaar is, de juiste canonical gebruikt en distinct content bevat. Voeg hem toe aan de XML-sitemap, link er intern naartoe en gebruik daarna de URL Inspection-tool van Search Console om indexering aan te vragen.

Hoe kan ik checken of mijn HTML-pagina geïndexeerd is?

Gebruik URL Inspection in Google Search Console. “URL is op Google” betekent geïndexeerd. De site:-operator is alleen een grove check, omdat Google zegt dat hij niet noodzakelijk alle geïndexeerde URL’s teruggeeft.

Hoe lang duurt het voordat Google een nieuwe pagina indexeert?

Er is geen gegarandeerde planning. John Mueller zei dat indexering meerdere uren tot meerdere weken kan duren. De Search Console-documentatie zegt dat aangevraagde indexering tot een week of twee kan duren.

Waarom staat mijn pagina als “Gecrawld, momenteel niet geïndexeerd”?

Google heeft de pagina opgehaald maar gekozen om hem nu niet op te slaan. Check of hij distinct waarde biedt, of hij een andere pagina dupliceert, of dat hij naar een andere canonical verwijst. Google zegt dat er geen noodzaak is om hem alleen opnieuw in te dienen voor crawling.

Stop robots.txt een pagina om geïndexeerd te worden?

Niet betrouwbaar. Robots.txt blokkeert crawling, maar een geblokkeerde URL die via links is ontdekt, kan alsnog verschijnen zonder de inhoud. Om indexering te voorkomen, laat je Google de pagina crawlen en voeg je een noindex-directive toe.

Heb ik een XML-sitemap nodig om geïndexeerd te worden?

Nee. Google kan pagina’s ontdekken door links te volgen. Een sitemap is nog steeds de schoonste manier om canonical URL’s op schaal door te geven, en Google raadt aan om er één in te dienen wanneer je veel pagina’s geïndexeerd wilt hebben.

SEOJuice
Stay visible everywhere
Get discovered across Google and AI platforms with research-based optimizations.
Works with any CMS
Automated Internal Links
On-Page SEO Optimizations
Get Started Free

no credit card required

More articles

No related articles found.