Robots.txt: waarom het ertoe doet voor ondernemers
Voor de meeste MKB-sites is dit bestand een van die dingen die je één keer goed instelt en daarna nooit meer aanraakt. Juist daarom gaat het zo vaak mis. Bij een verhuizing of herbouw blijft het bestand van de testomgeving staan, waarin alles is dichtgezet, en dan verdwijnt je hele site binnen enkele weken uit Google.
Waar het wél nuttig is: crawlbudget besparen op grote sites. Heeft je webshop duizenden filtercombinaties die allemaal een eigen URL opleveren, dan is het zonde als Google zijn tijd daaraan besteedt in plaats van aan je productpagina's. Voor een site van vijftig pagina's speelt dat niet en kun je het bestand grotendeels met rust laten.
Hoe een gezond bestand eruitziet
Een normaal robots.txt-bestand geeft alle crawlers toegang, sluit alleen de delen uit die niets in de zoekresultaten te zoeken hebben, en verwijst naar je sitemap. Denk aan interne zoekresultaten, bedanktpagina's en de beheeromgeving. Elke regel begint met User-agent, gevolgd door Allow- of Disallow-regels.
De fout die het meeste kost, past op één regel: Disallow: / onder User-agent: *. Dat sluit je volledige website af. Controleer na elke livegang of migratie dus als eerste jouwdomein.nl/robots.txt in je browser. Het kost tien seconden en voorkomt een probleem dat maanden kost om te herstellen.
Houdt robots.txt een pagina uit Google?
Niet betrouwbaar. Blokkeer je een pagina, dan mag Google hem niet lezen, maar hij kan alsnog in de resultaten verschijnen als andere sites ernaar linken, dan zonder omschrijving. Wil je een pagina echt uit de index houden, gebruik dan een noindex-instructie en blokkeer hem juist niet.
Heeft elke website een robots.txt nodig?
Nodig is het niet: zonder bestand mogen crawlers gewoon alles bekijken. Het is wel handig om er een te hebben, al is het alleen om je sitemap erin aan te melden. Voor kleine sites hoeft er verder vrijwel niets in te staan.
Hoe controleer ik of mijn robots.txt klopt?
Open jouwdomein.nl/robots.txt in je browser en lees mee. Zie je Disallow: / staan, dan is dat vrijwel altijd fout. Google Search Console laat daarnaast per URL zien of een pagina geblokkeerd wordt, wat handig is als je twijfelt over één specifieke regel.
Hulp nodig hierbij?
SEO uitbesteden aan een vaste specialistCrawl- en indexeringsinstellingen controleren we bij elke migratie en bij elke maandelijkse ronde.
Geschreven door Britt Daemen, oprichter en seo- & geo-specialist bij b. analyzed.
Terug naar de kennisbank